VoiceStudio 解读:1.5 万 Star 的本地语音工作台,16 个 TTS + 11 个 ASR 引擎,无需账户
语音 AI 这两年发展很快,但大多数人用的还是 ElevenLabs 这类云服务:需要注册账户、充值订阅、把音频数据上传到服务器。对于有隐私需求的用户——比如处理内部会议录音、敏感客户数据、或者只是不想被用量计量——云服务并不总是合适。
VoiceStudio(前身为 OmniVoice-Studio)提供了另一个选择:一个完全本地运行的语音工作台,集成了 16 个文本转语音(TTS)引擎和 11 个语音转文本(ASR)引擎,支持 646 种语言,不需要账户、API Key、订阅或用量计量。GitHub 上已超过 1.5 万 Star,AGPL-3.0 协议开源。
项目地址:https://github.com/debpalash/VoiceStudio
一、它是什么
VoiceStudio 的定位一句话就能说清楚:本地优先的语音克隆、配音、听写和长音频处理工作台。
它不是一个单一的 TTS 模型,而是一个统一的桌面应用,把业界主流的开源语音模型(TTS 和 ASR)都集成进来,通过统一的界面和 API 调用。你可以在不同引擎之间切换(快捷键 Ctrl/Cmd + E),根据任务选择最合适的模型。
核心原则是 Local-first:核心工作流完全在本地运行,声音、项目、设置和输出默认都保存在本机。需要网络的功能(如远程工作节点、OpenAI 兼容 ASR)都是明确的 opt-in,界面会清楚标识音频何时离开本机。
支持的平台:
- macOS 13.3+(Apple Silicon,Intel Mac 需用远程后端)
- Windows 10/11 x64
- Linux x86_64(glibc 2.39+)
- Docker(CUDA、ROCm 或 CPU)
二、核心功能
VoiceStudio 覆盖了语音处理的完整工作流:
| 功能 | 说明 |
|---|---|
| 语音克隆 | 从短参考音频零样本合成目标声音,3 秒即可,5-15 秒效果更好 |
| 语音设计 | 通过年龄、口音、音调、风格、表达指令创建新声音 |
| 视频配音 | 转录 → 翻译 → 保留说话人 → 合成 → 导出视频,完整流水线 |
| 故事/有声书 | 多角色脚本、EPUB/PDF 导入、章节渲染、.m4b 格式导出 |
| 听写小部件 | 系统级快捷键、实时转录、可选本地 LLM 文本清理 |
| 人声隔离 | 基于 Demucs 的语音/背景声分离 |
| 说话人分离 | 基于 Pyannote 和 WhisperX 的说话人分配 |
| 批量队列 | 大量音频/视频任务排队处理,每个任务独立进度 |
| 模型目录 | 安装、卸载、选择、路由 TTS/ASR/LLM 模型 |
| 远程模型下载 | 在已注册的远程工作节点上安装模型,实时进度 |
| GPU 自动检测 | CUDA、MPS、ROCm、CPU 自动路由,每个引擎单独检查 |
| AI 水印 | AudioSeal 水印嵌入和检测 |
| MCP Server | 为 MCP 客户端提供合成和转录工具 |
| 诊断工具 | 自检、错误日志、清理后的支持包 |
三、16 个 TTS 引擎
VoiceStudio 最大的特色之一是引擎生态。它不是绑定一个模型,而是把 16 个开源 TTS 引擎都集成进来,你可以根据语言、克隆能力、指令跟随、平台和许可证选择最合适的。
| 引擎 | 语言数 | 克隆 | 指令 | 平台 | 许可证 |
|---|---|---|---|---|---|
| VoiceStudio(默认,基于 OmniVoice) | 600+ | 是 | 是 | CUDA/CPU、MPS、CUDA/CPU | AGPL-3.0 应用 / Apache-2.0 模型 |
| CosyVoice 3 | 9 + 18 方言 | 是 | 是 | CUDA/CPU | Apache-2.0 |
| GPT-SoVITS | 5 | 是 | — | CUDA/CPU | MIT |
| VoxCPM2 | 30 | 是 | 是 | CUDA/CPU、MPS | Apache-2.0 |
| MOSS-TTS-Nano | 20 | 是 | — | CUDA/CPU | Apache-2.0 |
| KittenTTS | 英语 | — | — | CPU | MIT |
| MLX-Audio | 取决于模型 | 不定 | 不定 | MLX(Apple Silicon) | 不定 |
| Sherpa-ONNX | 20+ | — | — | CUDA/CPU | Apache-2.0 |
| IndexTTS 2.5 | 中/英/日/西/阿 | 是 | — | CUDA/CPU | Bilibili 模型许可证 |
| OmniVoice GGUF | 600+ | 是 | 是 | CUDA/CPU、MPS/CPU | AGPL-3.0 / Apache-2.0 |
| PocketTTS | 英/法/德/葡/意/西 | 是 | — | CPU | CC-BY-4.0(需授权) |
| Supertonic 3 | 31 | — | — | CPU | OpenRAIL-M |
| MOSS-TTS-v1.5 | 31 | 是 | — | CUDA/CPU | Apache-2.0 |
| dots.tts | 24 | 是 | — | CUDA/CPU | Apache-2.0 |
| Confucius4-TTS | 14 | 是 | — | CUDA/CPU | Apache-2.0 |
默认引擎是 VoiceStudio 自己的(基于 k2-fsa/OmniVoice),支持 600+ 语言、零样本克隆和指令跟随。对于中文用户,CosyVoice 3(支持 9 种语言 + 18 种方言)和 IndexTTS 2.5(中英日西阿)都是不错的选择。
不支持克隆的引擎无法在配音或固定声音批量任务中保留参考说话人,VoiceStudio 会拒绝这些任务而不是静默切换引擎。
四、11 个 ASR 引擎
语音转文本方面,VoiceStudio 集成了 11 个引擎:
| 引擎 | 语言 | 适用场景 |
|---|---|---|
| WhisperX(默认) | ~100 | 配音、字幕、词级时间戳 |
| Faster-Whisper | ~100 | 通用跨平台转录 |
| Faster-Whisper(隔离) | ~100 | 崩溃隔离的批量转录 |
| MLX Whisper | ~100 | Apple Silicon 优化 |
| PyTorch Whisper | ~100 | CUDA、MPS、CPU 回退 |
| Parakeet TDT | 英语 + 25 欧盟语言 | 快速 CPU/CUDA 转录 |
| Parakeet TDT v3 (MLX) | 25 欧盟语言 | Apple Silicon 听写和词时间戳 |
| Moonshine | 英语 | 低功耗、低延迟 ONNX |
| FunASR | 50+ | VAD 和内联说话人分离 |
| sherpa-onnx | 取决于模型 | 流式 CPU 听写 |
| OpenAI-compatible(远程) | 取决于服务器 | Qwen3-ASR 等兼容端点(音频离开本机) |
WhisperX 和 Faster-Whisper 在高效 float16 不可用时会自动回退到 int8。
五、本地优先架构
VoiceStudio 的技术栈清晰分层:
Tauri v2 桌面壳(Rust)
│ IPC
React + Vite UI
│ HTTP · SSE · WebSocket on localhost:3900
FastAPI 后端
├── TTS / ASR 引擎注册表
├── 配音 / 音频 / 长音频流水线
├── OpenAI 兼容 API 和 MCP Server
└── SQLite + Alembic → omnivoice_data/
| 层 | 路径 | 职责 |
|---|---|---|
| 桌面壳 | frontend/src-tauri/ | 窗口生命周期、托盘、快捷键、更新器、sidecar 启动 |
| 前端 | frontend/src/ | React UI、Zustand 状态、API 和事件客户端、i18n |
| API | backend/api/ | REST 路由、schema、认证边界、流式 |
| 核心服务 | backend/services/ | 生成、配音、音频处理、持久化 |
| 引擎 | backend/engines/ | 隔离的可选引擎适配器 |
| 工作节点 | backend/worker/ | 认证的远程计算和任务传输 |
| 数据 | omnivoice_data/ | 项目、声音、设置、日志、SQLite 状态 |
网络边界设计:
- 桌面端只与
localhost:3900的回环后端通信 - 回环 API 调用不需要服务器密钥,远程访问需要共享 PIN 或 API 密钥
- 远程工作节点和 OpenAI 兼容 ASR 是 opt-in,UI 会标识音频何时离开本机
- 分析功能默认关闭,启用后只发送白名单的、无内容的使用元数据——不发送文本、音频、文件名或项目
六、OpenAI 兼容 API 和 MCP
VoiceStudio 不只是一个桌面应用,它还是一个本地语音平台。后端提供了 OpenAI 兼容的音频 API,你可以把任何 OpenAI 兼容的音频客户端指向本地后端:
- base_url="https://api.openai.com/v1"
+ base_url="http://localhost:3900/v1"
支持的端点:
| 端点 | 用途 |
|---|---|
POST /v1/audio/speech | TTS,输出 mp3/opus/aac/flac/wav/pcm,用 voice 选择声音配置,model 选择引擎 |
POST /v1/audio/transcriptions | STT,输出 json/text/verbose_json/srt/vtt |
WS /v1/audio/transcriptions/stream | 实时 PCM/WebM 转录,支持部分、话语、会话最终事件 |
GET /v1/audio/voices | 列出本地声音配置和引擎 |
GET /.well-known/voicestudio-speech | 发现 HTTP、WebSocket、MCP、原生听写控制传输 |
Python 示例:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:3900/v1", api_key="local")
with client.audio.speech.with_streaming_response.create(
model="tts-1",
voice="<profile-id>",
input="Made on my own hardware.",
response_format="wav",
) as response:
response.stream_to_file("speech.wav")
此外,VoiceStudio 还提供了 MCP Server,可以为 Claude Code、Cursor 等 MCP 客户端提供语音合成和转录工具。也可以通过 npx skills add debpalash/VoiceStudio 安装 Agent Skills。
七、安装与系统要求
安装:从 GitHub Releases 下载对应平台的安装包(macOS DMG、Windows MSI、Linux AppImage)。首次启动会创建托管的 Python 环境并下载默认模型,后续启动复用。
macOS 首次启动需要右键 → 打开 进行一次批准。
从源码运行:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
系统要求:
| 最低 | 推荐 | |
|---|---|---|
| 操作系统 | Windows 10 x64 / macOS 13.3 Apple Silicon / Linux glibc 2.39+ | 当前支持的 OS 版本 |
| 内存 | 8 GB | 16 GB+ |
| 磁盘 | 10 GB 可用 | 20 GB+ SSD |
| GPU | 可选,支持 CPU 模式 | NVIDIA CUDA 或 Apple Silicon |
| 显存 | 使用 GPU 时 4 GB | 8 GB+,大型可选引擎需要更多 |
计算支持:CUDA、Apple Silicon MPS/MLX、ROCm(仅 Linux,opt-in)、CPU、可选远程工作节点。VRAM 不足时会自动卸载到 CPU。
八、与云语音服务的对比
| 维度 | VoiceStudio | 典型云语音服务(如 ElevenLabs) |
|---|---|---|
| 最佳适用 | 隐私、离线、自托管、高批量 | 快速上手,无需本地模型管理 |
| 数据路径 | 默认本地,远程功能 opt-in | 音频和文本由服务商处理 |
| 成本模式 | 免费软件,自己提供硬件 | 订阅、积分或计量 API |
| 设置 | 安装应用和模型权重 | 创建账户,使用 Web 应用或 API |
| 性能 | 取决于引擎和硬件 | 服务商管理计算和扩展 |
| 离线使用 | 模型安装后可以 | 通常需要网络连接 |
| 定制化 | 源码、引擎、模型、API、路由全开放 | 限于服务商选项 |
| 维护 | 自己管理更新、磁盘和计算 | 服务商管理基础设施 |
简单说,云服务适合"快速上手、不想管硬件",VoiceStudio 适合"数据要留在本地、想要更多控制和定制"。
九、适用场景与局限
适用场景:
- 隐私敏感的语音处理:内部会议录音、客户数据、医疗音频等不能上传到云端的场景
- 有声书和播客制作:多角色脚本、EPUB/PDF 导入、章节渲染、
.m4b导出 - 视频配音和字幕:完整的转录 → 翻译 → 配音流水线,保留说话人
- 开发者本地语音 API:OpenAI 兼容的本地 TTS/ASR API,适合开发和测试
- AI Agent 语音能力:通过 MCP Server 或 Agent Skills 为 Claude Code、Cursor 等提供语音能力
- 语言学习和方言研究:646 种语言目录,支持多种方言
- 批量音频处理:批量队列支持大量任务排队处理
局限:
- 仍处于 Active Beta:建议用最新 Release 进行稳定工作,
main分支包含当前修复 - 需要本地硬件:GPU 推理效果更好,CPU 模式可用但速度较慢
- 模型下载需要网络:首次使用需要下载模型权重(之后可离线)
- 引擎质量参差不齐:16 个 TTS 引擎的质量、语言覆盖和克隆能力差异较大,需要根据任务选择
- AGPL-3.0 协议:应用本身是 AGPL-3.0,商业使用需要注意协议合规(各引擎模型有自己的许可证)
- Intel Mac 不支持本地 Python 后端:需要使用远程后端
十、总结
VoiceStudio 代表了语音 AI 工具的一个重要方向:从"依赖云服务"到"本地优先、引擎可切换、API 开放"。
它不是一个单一的语音模型,而是一个统一的工作台,把业界 16 个 TTS 引擎和 11 个 ASR 引擎都集成进来,让用户可以根据任务、语言和硬件选择最合适的模型。同时,它提供了 OpenAI 兼容的本地 API 和 MCP Server,让开发者可以轻松地把语音能力集成到自己的应用和 AI Agent 中。
对于有隐私需求、想要更多控制、或者只是不想被云服务用量计量的用户,VoiceStudio 提供了一个功能完整、引擎丰富、完全本地的替代方案。1.5 万 Star 的热度也说明,这个方向有大量真实需求。
如果你正在做语音相关的工作,或者对本地 AI 工具感兴趣,不妨试试 VoiceStudio——在自己的硬件上运行语音克隆、配音和听写,数据完全不出本机。
项目地址:https://github.com/debpalash/VoiceStudio