语音克隆不用上云:Voicebox本地工作站集成7个TTS引擎
ElevenLabs 在 2023 年的爆火,说明了 AI 语音合成的需求很旺盛。大家都渴望着能用自己的声音生成配音,或者克隆某个喜欢的音色,于是纷纷选择订阅各种在线服务。
但现实是:大部分在线服务要把自己的数据传到云端,还要出订阅费,每个月几十美元。你的声音样本、训练好的模型全锁在别人的服务器上,哪天服务涨了价或者干脆关了,你什么也带不走。也有人折腾开源方案,但折腾一圈下来,发现大部分工具的体验还停留在命令行敲一敲、能出声就行的阶段。想做个多角色的对话?想给生成的语音加个混响?想用不同引擎对比一下效果?对不起,你得自己拼。
最近一个名为 Voicebox 的项目在 GitHub 上开源,采用本地化语音克隆方案,让每个人都能在自己的电脑上完成专业级配音制作。GitHub 上已获取 21K Star。
它是一个完全本地运行的语音克隆工作站,集成了 7 个 TTS 引擎,带多轨道编辑器,还有完整的 API——ElevenLabs 能做的事它基本都能做,只不过全在你自己机器上跑,免费。
7 个 TTS 引擎
- Qwen3-TTS(阿里巴巴开源):主力引擎,有 0.6B 和 1.7B 两个版本,支持 10 种语言,克隆质量很高,可以给它写"表演指令",做有声书、做配音的最佳选择
- LuxTTS:只要 1GB 显存,CPU 上能跑到 150 倍实时速度,输出还是 48kHz 高采样率,适合快速出草稿听效果
- Chatterbox Multilingual:23 种语言,阿拉伯语、芬兰语、斯瓦希里语这种小语种都支持
- Chatterbox Turbo:只有 350M 参数,但能理解副语言标签——在文本里写
[laugh]、[sigh]、[gasp],它真的会笑、叹气、倒吸一口气,输入框里敲/就能弹出标签选择器 - TADA:更长的语音-语言模型,有 1B 和 3B 两个版本,能生成 700 秒以上的连贯音频,时间戳精确到音素级别
- Kokoro:最小的那个,只有 82M 参数,自带 50 个精选预设声音,对硬件要求最低
三大差异化能力
本地运行,数据不出设备:所有推理、克隆、生成都在你的机器上完成。macOS 上走 MLX/Metal,Apple Silicon 能快 4 到 5 倍;Windows 上走 CUDA,NVIDIA 显卡自动识别;AMD 和 Intel Arc 也都有对应的后端支持。
能做一整期播客:大部分 TTS 工具的逻辑是先输入文字、生成音频就结束了,但做过语音内容的人知道,真正的麻烦不是生成一段话的语音,是把多段话拼成完整的内容。要做一期两人对话的播客,你得先生成 A 的台词,再生成 B 的台词,然后拖进音频编辑软件里对时间轴、调音量、加过渡,一段 5 分钟的对话光拼接可能就要折腾半小时。
Voicebox 的 Stories 编辑器是一个多轨道时间轴编辑器,长得有点像简化版的 DAW。你可以把不同声音的生成结果拖到不同轨道上,直接在时间轴上排列、修剪、分割,播放头会同步走,随时听效果。
8 种后处理效果:音调偏移、混响、延迟、合唱/法兰、压缩、增益、高通滤波、低通滤波,都可以在生成音频后直接调整,背后用的是 Spotify 的 pedalboard 库,质量扎实。还支持实时预览,调好参数后保存成预设。内置了 4 个预设:Robotic(机器人声)、Radio(收音机质感)、Echo Chamber(回声室)、Deep Voice(低沉嗓音),也可以自己创建。效果还能绑定到声音档案上,比如你有一个"旁白"的档案默认就带混响和压缩,每次用这个声音生成效果自动带上。
应用场景
- 多角色有声书制作:输入不同角色的台词,为每个角色创建独立的声音档案,在 Stories 编辑器里排列时间轴,一键导出完整的有声书
- 播客对话生成:两人甚至多人的对话场景,每个声音独立轨道,支持实时预览和效果调整,5 分钟的对话内容从生成到导出可能只需要 10 分钟
- 视频配音与后期:生成的音频自带后处理效果,混响、压缩、音调调整一站式完成,不用再切到 Audition 或 Premiere 做二次处理
安装与使用
去官网 voicebox.sh 下载安装包,macOS 有 Apple Silicon 和 Intel 两个版本,Windows 是 MSI 安装包,也可以 Docker 一键启动:
git clone https://github.com/jamiepine/voicebox
cd voicebox
docker compose up
应用启动后,先把模型装好。点界面右上角的立方体图标进入模型管理页面,新手建议先下两个:Qwen3-TTS 的 1.7B 版本(效果好)和 Whisper Small(克隆声音时用来转录样本)。第一次下载过程可能要几分钟,模型下载完会自动加载,状态变成绿色就能用了。
创建声音档案:点左侧的 Profiles 标签,再点右上角的"+"号。有 3 种方式:直接拖一段 WAV 或 MP3 进去自动上传;直接点录音按钮对着麦克风说 10-20 秒;或者从系统音频里截取。录完之后点保存,给档案起个名字。
生成语音:在主界面文本框里输入想生成的内容,选 Qwen3-TTS 引擎,语言选中文,声音档案选择前面创建的档案,点"Generate"生成,等几秒音频就出来了。
REST API
想把它集成到自己的项目里也支持,Voicebox 暴露了完整的 REST API,默认跑在 localhost:17493,生成语音、管理声音档案、查询状态都有接口,详细文档访问 localhost:17493/docs。
curl -X POST http://localhost:17493/generate \
-H "Content-Type: application/json" \
-d '{"text": "你好,这是Voicebox生成的语音", "profile_id": "你的档案ID", "language": "zh"}'
注意用 CPU 也能跑但是很慢,想要流畅的体验还是需要 GPU 加速,推荐用 macOS,MLX/Metal 能让 Apple Silicon 快 4 到 5 倍。Linux 目前没有现成的安装包,得从源码编译。
项目基于 MIT 协议开源,可商用,也能二次开发。
项目地址:https://github.com/jamiepine/voicebox