Voicebox:本地运行的 AI 语音工作室,克隆、听写、创作三合一
Voicebox:本地运行的 AI 语音工作室,克隆、听写、创作三合一
3 秒音频克隆任意声音,7 个 TTS 引擎 23 种语言,全局热键听写到任意应用,还能让你的 AI Agent 用你的声音说话——全部本地运行,零云端依赖。
2026 年 5 月,Consumer Reports 对六大商业语音克隆平台(ElevenLabs、Speechify、PlayHT、Lovo、Descript、Resemble AI)做了安全评估,发现其中四个只需要勾一个复选框就能克隆任何人的声音,没有技术手段验证说话者是否同意。与此同时,一个叫 Voicebox 的开源项目在 GitHub 上悄然突破 29,000 Star——它不收月费、不需要登录、不把音频发到任何服务器,甚至不需要联网。
Voicebox 的口号很简单:Clone, dictate, create(克隆、听写、创作)。
这篇文章拆解它的技术架构、核心功能、安全争议和实际用法。
本文提纲
- 这是什么?
- 技术架构:Tauri + Python + 三层 GPU 加速
- 核心功能拆解
- 七大 TTS 引擎对比
- MCP 协议:让 AI Agent 说话
- 全局热键听写:从语音到文字的完整链路
- Stories:多轨音频时间线编辑器
- 安全争议:开源的代价
- 安装与使用
- 和 ElevenLabs 的对比
一、这是什么?
Voicebox 是开发者 Jamie Pine(加拿大,也是 Spaceddrive 文件管理器的作者)和 maskedsyntax 共同开发的开源 AI 语音工作室。
一句话定位:本地运行的 ElevenLabs 替代品。
| 维度 | Voicebox | ElevenLabs |
|---|---|---|
| 部署方式 | 完全本地 | 云端 SaaS |
| 价格 | 免费(MIT 协议) | $22-$99/月 |
| 语音克隆 | 3 秒音频即可 | 需上传到服务器 |
| 数据隐私 | 音频不离开本机 | 上传到 ElevenLabs 服务器 |
| TTS 引擎 | 7 个可选 | 1 个专有引擎 |
| 语言支持 | 23 种 | 30+ |
| Agent 集成 | MCP 协议原生支持 | 需 API 调用 |
| 商用许可 | MIT,无限制 | 需付费套餐 |
核心数据(截至 2026 年 7 月):
- GitHub Star:29,000+
- 提交数:624+
- 首次发布:2026 年 1 月 25 日
- 最新版本:0.5.0("Capture")
- 许可证:MIT
二、技术架构:Tauri + Python + 三层 GPU 加速
Voicebox 不是简单的 Python 脚本包了一层 GUI。它是一个精心设计的混合架构桌面应用:
graph TB
subgraph "Tauri 桌面框架"
subgraph "Rust 原生层"
R1[keytap
全局键盘监听]
R2[reqwest
SSE 监听]
R3[合成粘贴
模拟 Cmd+V]
end
subgraph "React 前端层"
W1[shadcn/ui 组件库]
W2[WaveSurfer.js
波形可视化]
W3[Zustand 状态管理]
W4[React Query 缓存]
W5[i18n 四语言]
end
end
subgraph "Python 后端"
P1[FastAPI
Web 框架]
P2[PyTorch
模型推理]
P3[FastMCP
MCP 服务器]
P4[SQLAlchemy
+ SQLite]
P5[librosa
音频处理]
end
subgraph "AI 模型层"
M1[Whisper
语音转文字 STT]
M2[Qwen3
本地 LLM 0.6B-4B]
M3[Qwen3-TTS
文本转语音]
M4[Chatterbox
多语言 TTS]
M5[Kokoro 82M
轻量 TTS]
M6[HumeAI TADA
情感 TTS]
M7[LuxTTS]
end
subgraph "GPU 加速层"
G1[CUDA
NVIDIA]
G2[ROCm
AMD]
G3[MLX
Apple Silicon]
G4[DirectML
Intel XPU]
G5[CPU
回退]
end
R1 --> P1
R2 --> P1
R3 --> W1
W1 --> P1
P1 --> P2
P2 --> M1 & M2 & M3 & M4 & M5 & M6 & M7
P2 --> G1 & G2 & G3 & G4 & G5
P3 --> P1
style R1 fill:#FF6B6B,color:#fff
style M1 fill:#4ECDC4,color:#000
style P3 fill:#FFA07A,color:#000三层架构的分工:
| 层 | 技术 | 职责 |
|---|---|---|
| Rust 原生层 | Tauri + keytap | 全局热键监听、合成粘贴、SSE 连接管理 |
| Python 后端 | FastAPI + PyTorch | 模型推理、MCP 服务器、音频处理、数据持久化 |
| React 前端 | Vite + shadcn/ui | UI 渲染、波形可视化、时间线编辑 |
GPU 加速:四平台全覆盖
这是 Voicebox 的一个工程亮点——它不是只支持 NVIDIA,而是覆盖了所有主流 GPU 平台:
| GPU 平台 | 技术 | 支持状态 | 备注 |
|---|---|---|---|
| NVIDIA | CUDA | ✅ | 自动检测,cu128 |
| AMD | ROCm | ✅ | Windows 原生支持(2026.07 PR #538) |
| Apple Silicon | MLX | ✅ | M 系列芯片原生 |
| Intel | DirectML/XPU | ✅ | PR #320(2026.03) |
| 无 GPU | CPU | ✅ | 自动回退 |
后端变体会持久化:你选了 CUDA 或 ROCm,重启后仍保持。也支持手动覆盖。
项目结构
voicebox/
├── app/ # 共享 React 前端
├── tauri/ # 桌面应用(Tauri + Rust)
├── web/ # Web 部署
├── backend/ # Python FastAPI 服务器
├── landing/ # 营销网站
├── scripts/ # 构建和发布脚本
├── docs/ # 文档
├── .agents/ # AI Agent 技能定义
└── .github/ # CI/CD 配置三、核心功能拆解
3.1 语音克隆(Voice Cloning)
只需 3 秒音频样本,就能创建一个可用的语音配置文件(Voice Profile)。
流程:
- 录制或导入一段音频
- 系统提取声纹特征
- 生成 Voice Profile
- 后续 TTS 生成时选择该 Profile
Voice Profile 还可以附加可选的"个性"设定——比如让克隆的声音说话时带有特定语气、用词偏好或角色性格。这个功能由本地 Qwen3 LLM 驱动。
3.2 全局热键听写(Dictation / Capture)
这是 0.5.0 版本的核心新功能。Voicebox 不再只是一个 TTS 工具——它变成了一个完整的语音输入输出平台。
两种触发模式:
| 模式 | 交互方式 | 适合场景 |
|---|---|---|
| Push-to-Talk (PTT) | 按住热键说话,松开结束 | 短指令、快速输入 |
| Toggle-to-Talk | 按一次开始,再按一次结束 | 长段落听写 |
完整链路:
sequenceDiagram
participant U as 用户
participant K as keytap (Rust)
participant P as Capture Pill (悬浮胶囊)
participant W as Whisper
participant L as Qwen3 LLM
participant A as 目标应用
U->>K: 按下热键组合
K->>K: ChordMatcher 匹配
K->>P: 开始录音
P->>U: 显示"录音中"
U->>K: 松开/再按
K->>P: 停止录音
P->>U: 显示"转录中"
P->>W: 发送音频
W->>W: Whisper 转录
W->>W: 循环消除处理
W->>P: 返回文本
alt LLM 优化启用
P->>L: 发送原始文本
L->>L: 去填充词/修标点/风格重写
L->>P: 返回优化文本
end
P->>U: 显示"优化中" → "完成"
P->>A: 模拟 Cmd+V / Ctrl+V
A->>U: 文本出现在光标位置Whisper 循环消除——一个工程细节值得注意:
Whisper 模型在转录时经常产生"循环"——同一段文字重复出现。Voicebox 在送入 LLM 之前做了确定性的循环检测和清除:
- 单词级处理:检测连续重复的单词(如 "the the the")
- 字符级处理:非贪婪正则匹配 2-60 字符的重复子串
- CJK 检测:专门处理中日韩无空格文本的循环
- 保留强调:不会把 "wooooooow" 这种合理的字母重复删掉
项目内置了 10 段转录评估套件来验证不同模型大小的循环消除效果。
3.3 语音个性(Personalities)
每个 Voice Profile 可以附加一个"个性"——类似于给声音克隆一个"灵魂"。
| 操作 | 功能 | 实现 |
|---|---|---|
| Compose(创作) | 根据主题生成文本 | Qwen3 LLM |
| Rewrite(重写) | 按个性风格重写输入 | Qwen3 LLM |
| Respond(回复) | 根据上下文生成回复 | Qwen3 LLM |
例如:你克隆了自己的声音,并设置个性为"科技博主"。当你用听写功能说话时,Qwen3 会把你的口语化转录优化成科技博客风格的文字——全部在本地完成,不经过任何外部 API。
3.4 文本转语音(TTS)
支持 7 个 TTS 引擎,可在不重启应用的情况下逐次切换:
| 引擎 | 参数量 | 特点 | 语言 |
|---|---|---|---|
| Qwen3-TTS | 0.6B / 1.7B | 阿里通义出品,高质量 | 多语言 |
| Chatterbox Multilingual | — | 多语言支持 | 多语言 |
| Chatterbox Turbo | — | 快速生成 | 多语言 |
| Kokoro | 82M | 轻量极速 | 英语为主 |
| HumeAI TADA | 1B / 3B | 情感感知 TTS | 英语 / 多语言 |
| LuxTTS | — | — | — |
| Qwen CustomVoice | — | 自定义声音 | 多语言 |
生成过程通过 SSE(Server-Sent Events)实时推送状态,前端可以显示生成进度。生成完成后可自动播放,"Play As" 功能还支持用不同 Voice Profile 播放同一段文本。
四、MCP 协议:让 AI Agent 说话
这是 Voicebox 最有想象力的功能。
Voicebox 内置了一个 FastMCP 服务器,挂载在 /mcp 路径(Streamable HTTP 模式),暴露了 4 个工具供 AI Agent 调用:
| MCP 工具 | 功能 | 用途 |
|---|---|---|
voicebox.speak |
语音合成 | 让 Agent 用指定声音"说话" |
voicebox.transcribe |
音频转录 | 让 Agent"听"音频文件 |
voicebox.list_captures |
列出录音 | 让 Agent 查询历史录音 |
voicebox.list_profiles |
列出语音配置 | 让 Agent 选择不同声音 |
支持的 AI Agent 客户端:
- Claude Code
- Cursor
- Windsurf
- VS Code MCP 扩展
- 任何支持 MCP 协议的客户端
实际场景举例:
- 让 Claude Code 用你的声音读代码注释——你克隆了自己的声音,Claude Code 在解释代码时通过
voicebox.speak用你的声音说出来 - Cursor 听写重构——你对着 Cursor 说话描述重构需求,
voicebox.transcribe转成文字,Cursor 据此执行 - 多声音播客——Agent 用不同 Voice Profile 为不同角色配音,自动生成播客
安全细节:voicebox.transcribe(audio_path=...) 被限制为只能从本地回环地址调用,防止远程攻击者通过 MCP 读取你机器上的任意音频文件。
还提供 POST /speak REST 接口供非 MCP 客户端使用,以及通过 mcp_shim 代理支持 stdio MCP 客户端。
五、Stories:多轨音频时间线编辑器
Voicebox 不只是"输入文字→输出音频"。它还内置了一个完整的音频编辑器:
| 功能 | 说明 |
|---|---|
| 多轨道编辑 | 支持多个音轨并行排列 |
| 剪辑操作 | 分割、复制、删除、重新生成 |
| 逐剪辑音量 | 线性增益 0.0-2.0,实时生效 |
| 外部音频导入 | 拖放导入,支持 wav/mp3/flac/ogg/m4a/aac/webm(最大 200MB) |
| 缩放控制 | 基于项目时长的自适应缩放范围 |
| 导出混音 | 服务端混音导出,按剪辑音量乘以裁剪后汇总 |
音频播放使用 Web Audio API 多轨混音,每个剪辑通过独立的 GainNode 控制音量。波形可视化使用 WaveSurfer.js。
六、安全争议:开源的代价
Voicebox 的核心卖点——完全本地、零云端、MIT 许可——同时也是它最大的争议点。
同一个硬币的两面
| 优势 | 风险 |
|---|---|
| 音频不离开本机 | 无审计日志追溯 |
| 无需登录 | 无账户追踪 |
| 无使用限制 | 无频率限制 |
| MIT 许可可商用 | 无商用伦理约束 |
| 3 秒即可克隆 | 可从任何公开视频提取声音 |
2026 年 5 月的 TechTimes 报道标题直接点明问题:"Voicebox Clones Any Voice From 3 Seconds of Audio, Runs Locally for Free, and Has No Consent Lock"
Voicebox 没有任何技术机制来验证被克隆声音的人是否同意。一个从公开视频提取的 3 秒音频片段,就能生成一个功能性的声音克隆。
和商业平台的对比
Consumer Reports 2025 年 3 月的评估发现:
| 平台 | 同意验证机制 | 账户追踪 | 审计日志 |
|---|---|---|---|
| ElevenLabs | 复选框自证 | ✅ | ✅ |
| Speechify | 复选框自证 | ✅ | ✅ |
| PlayHT | 复选框自证 | ✅ | ✅ |
| Lovo | 复选框自证 | ✅ | ✅ |
| Descript | 需语音样本验证 | ✅ | ✅ |
| Resemble AI | 需语音样本验证 | ✅ | ✅ |
| Voicebox | 无 | 无 | 无 |
商业平台至少有"复选框自证"这个弱威慑(虽然 Consumer Reports 认为这不足以阻止恶意使用)。Voicebox 连这个都没有——但反过来,商业平台的"弱威慑"也已经被证明不够用。
Voicebox 做了什么安全措施?
虽然没有同意验证,Voicebox 在其他安全层面做得相当扎实:
transcribe限制:只能从 localhost 调用,防止远程任意文件读取- macOS 权限管理:明确要求 Input Monitoring 和 Accessibility 权限
- 客户端 ID 中间件:记录
last_seen_at时间戳 - SSE 超时:45 秒无数据视为死流,指数退避重连(500ms→30s)
- 硬超时:60 秒强制关闭卡住的悬浮胶囊
- 数据库降级:SQLite < 3.35 不支持 DROP COLUMN 时安全跳过
- 安全报告流程:提供 SECURITY.md 指导负责任披露
七、安装与使用
下载安装
| 平台 | 方式 |
|---|---|
| macOS | 官网下载 .dmg |
| Windows | 官网下载 .exe(含 CUDA / ROCm 版本) |
| Linux | 从源码构建 |
| Docker | docker compose up |
官网:voicebox.sh
从源码构建
前置条件:Bun、Rust、Python 3.11+、Tauri 依赖、macOS 需 Xcode。
# 克隆仓库
git clone https://github.com/jamiepine/voicebox.git
cd voicebox
# 查看所有可用命令
just --list
# 构建 CPU 版本 + Tauri 应用
just build
# Windows: 构建 CPU + CUDA 版本
just build-local
# 开发模式
just serve快速上手(1-3 天体验路线)
Day 1: 声音克隆
├── 录制 10 秒自己的声音
├── 创建 Voice Profile
├── 输入文字生成语音
└── 听听克隆得像不像
Day 2: 语音输入
├── 绑定全局热键
├── 在任意输入框按住说话
├── 松手看转录结果
└── 开启 LLM 优化试试效果
Day 3: Agent 集成
├── 配置 .mcp.json
├── 在 Claude Code / Cursor 中测试
├── 让 Agent 用你的声音说话
└── 尝试 Stories 多轨编辑成功标准:你愿意用它生成的声音,去替代一次原本要上云端配音的活。
MCP 配置
仓库根目录自带 .mcp.json,在仓库目录下运行 Claude Code 会自动加载 Voicebox MCP 工具:
{
"mcpServers": {
"voicebox": {
"url": "http://localhost:8000/mcp"
}
}
}八、国际化与社区
Voicebox 支持四种语言:
| 语言 | 代码 |
|---|---|
| 英语 | en |
| 日语 | ja |
| 简体中文 | zh-CN |
| 繁体中文 | zh-TW |
项目使用 MIT 许可证,接受社区贡献。贡献流程:
- Fork 仓库
- 创建功能分支
- 提交 PR
项目还内置了 .agents/skills/ 目录,包含添加新 TTS 引擎的 Agent 技能定义——一个 AI 编码 Agent 可以根据引擎名称自主完成整个集成流程。
九、同类对比
| 维度 | Voicebox | ElevenLabs | PlayHT | OpenAI TTS |
|---|---|---|---|---|
| 部署 | 本地 | 云端 | 云端 | 云端 |
| 价格 | 免费 | $22-99/月 | $15-99/月 | 按 token 付费 |
| 语音克隆 | 3 秒样本 | 需付费 | 需付费 | 不支持 |
| 引擎数量 | 7 个 | 1 个 | 1 个 | 1 个 |
| 语言 | 23 种 | 30+ | 100+ | 50+ |
| Agent 集成 | MCP 原生 | API | API | API |
| 数据隐私 | 完全本地 | 上传服务器 | 上传服务器 | 上传服务器 |
| 离线使用 | ✅ | ❌ | ❌ | ❌ |
| 情感控制 | TADA 引擎 | ✅ | ✅ | 有限 |
| 多轨编辑 | ✅ | ❌ | ❌ | ❌ |
| 开源 | MIT | 闭源 | 闭源 | 闭源 |
Voicebox 的独特优势:
- 零成本——不限时长、不限字符
- 数据主权——音频永远不离开你的机器
- 多引擎——7 个 TTS 引擎随时切换,不是绑定单一模型
- MCP 原生——和 AI Agent 生态深度集成
- 多轨编辑——不只能生成,还能编辑混音
Voicebox 的不足:
- 安装门槛——需要 Python + Rust + Tauri 环境(虽然有预编译版本)
- 硬件要求——GPU 加速需要 NVIDIA/AMD/Apple Silicon,CPU 模式较慢
- 无同意验证——伦理争议
- Linux 支持不够完善——需要从源码构建
- 质量波动——7 个引擎质量参差不齐,Kokoro 82M 明显不如 Qwen3-TTS 1.7B
十、典型使用场景
| 场景 | 怎么用 | 用哪个引擎 |
|---|---|---|
| 播客制作 | 克隆多个声音,用 Stories 编辑多轨 | Qwen3-TTS 1.7B |
| 游戏 NPC 配音 | 为每个角色创建 Voice Profile | Chatterbox Multilingual |
| 无障碍工具 | 为视障用户朗读文本 | Kokoro(快速) |
| 内容自动化 | 文章→有声版批量生成 | Chatterbox Turbo |
| 语音助手开发 | 通过 MCP/REST API 接入 | Qwen3-TTS |
| Agent 语音输出 | Claude Code/Cursor 用你的声音说话 | Qwen3-TTS + MCP |
| 快速听写 | 全局热键→Whisper→LLM 优化→粘贴 | Whisper + Qwen3 |
| 情感配音 | 带情感色彩的 TTS | HumeAI TADA |
参考文档与链接
- Voicebox GitHub 仓库 — 源码、Issues、PR
- Voicebox 官网 — 下载、Demo 视频
- Voicebox 文档 — 安装、使用、开发指南
- TechTimes: Voicebox 安全分析 — 同意验证缺失争议
- Consumer Reports: 商业语音克隆平台评估 — 六大平台安全对比
- 今日头条: Voicebox 深度体验 — 中文体验报告
- 今日头条: Voicebox 2.9 万 Star — 中文介绍
- Jamie Pine GitHub — 作者主页(Spaceddrive 作者)
- MIT 许可证全文 — 开源协议
你会用它来做什么?克隆自己的声音让 Agent 替你说话,还是做播客配音?评论区聊聊。觉得有用,转发给同样在关注 AI 语音的朋友。
作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。
本文首发于 AI人工智能时代,转载请注明出处。