编程 VoiceStudio 解读:1.5 万 Star 的本地语音工作台,16 个 TTS + 11 个 ASR 引擎,无需账户

2026-09-05 18:12:06

VoiceStudio 解读:1.5 万 Star 的本地语音工作台,16 个 TTS + 11 个 ASR 引擎,无需账户

语音 AI 这两年发展很快,但大多数人用的还是 ElevenLabs 这类云服务:需要注册账户、充值订阅、把音频数据上传到服务器。对于有隐私需求的用户——比如处理内部会议录音、敏感客户数据、或者只是不想被用量计量——云服务并不总是合适。

VoiceStudio(前身为 OmniVoice-Studio)提供了另一个选择:一个完全本地运行的语音工作台,集成了 16 个文本转语音(TTS)引擎和 11 个语音转文本(ASR)引擎,支持 646 种语言,不需要账户、API Key、订阅或用量计量。GitHub 上已超过 1.5 万 Star,AGPL-3.0 协议开源。

项目地址:https://github.com/debpalash/VoiceStudio

一、它是什么

VoiceStudio 的定位一句话就能说清楚:本地优先的语音克隆、配音、听写和长音频处理工作台。

它不是一个单一的 TTS 模型,而是一个统一的桌面应用,把业界主流的开源语音模型(TTS 和 ASR)都集成进来,通过统一的界面和 API 调用。你可以在不同引擎之间切换(快捷键 Ctrl/Cmd + E),根据任务选择最合适的模型。

核心原则是 Local-first:核心工作流完全在本地运行,声音、项目、设置和输出默认都保存在本机。需要网络的功能(如远程工作节点、OpenAI 兼容 ASR)都是明确的 opt-in,界面会清楚标识音频何时离开本机。

支持的平台:

  • macOS 13.3+(Apple Silicon,Intel Mac 需用远程后端)
  • Windows 10/11 x64
  • Linux x86_64(glibc 2.39+)
  • Docker(CUDA、ROCm 或 CPU)

二、核心功能

VoiceStudio 覆盖了语音处理的完整工作流:

功能说明
语音克隆从短参考音频零样本合成目标声音,3 秒即可,5-15 秒效果更好
语音设计通过年龄、口音、音调、风格、表达指令创建新声音
视频配音转录 → 翻译 → 保留说话人 → 合成 → 导出视频,完整流水线
故事/有声书多角色脚本、EPUB/PDF 导入、章节渲染、.m4b 格式导出
听写小部件系统级快捷键、实时转录、可选本地 LLM 文本清理
人声隔离基于 Demucs 的语音/背景声分离
说话人分离基于 Pyannote 和 WhisperX 的说话人分配
批量队列大量音频/视频任务排队处理,每个任务独立进度
模型目录安装、卸载、选择、路由 TTS/ASR/LLM 模型
远程模型下载在已注册的远程工作节点上安装模型,实时进度
GPU 自动检测CUDA、MPS、ROCm、CPU 自动路由,每个引擎单独检查
AI 水印AudioSeal 水印嵌入和检测
MCP Server为 MCP 客户端提供合成和转录工具
诊断工具自检、错误日志、清理后的支持包

三、16 个 TTS 引擎

VoiceStudio 最大的特色之一是引擎生态。它不是绑定一个模型,而是把 16 个开源 TTS 引擎都集成进来,你可以根据语言、克隆能力、指令跟随、平台和许可证选择最合适的。

引擎语言数克隆指令平台许可证
VoiceStudio(默认,基于 OmniVoice)600+CUDA/CPU、MPS、CUDA/CPUAGPL-3.0 应用 / Apache-2.0 模型
CosyVoice 39 + 18 方言CUDA/CPUApache-2.0
GPT-SoVITS5CUDA/CPUMIT
VoxCPM230CUDA/CPU、MPSApache-2.0
MOSS-TTS-Nano20CUDA/CPUApache-2.0
KittenTTS英语CPUMIT
MLX-Audio取决于模型不定不定MLX(Apple Silicon)不定
Sherpa-ONNX20+CUDA/CPUApache-2.0
IndexTTS 2.5中/英/日/西/阿CUDA/CPUBilibili 模型许可证
OmniVoice GGUF600+CUDA/CPU、MPS/CPUAGPL-3.0 / Apache-2.0
PocketTTS英/法/德/葡/意/西CPUCC-BY-4.0(需授权)
Supertonic 331CPUOpenRAIL-M
MOSS-TTS-v1.531CUDA/CPUApache-2.0
dots.tts24CUDA/CPUApache-2.0
Confucius4-TTS14CUDA/CPUApache-2.0

默认引擎是 VoiceStudio 自己的(基于 k2-fsa/OmniVoice),支持 600+ 语言、零样本克隆和指令跟随。对于中文用户,CosyVoice 3(支持 9 种语言 + 18 种方言)和 IndexTTS 2.5(中英日西阿)都是不错的选择。

不支持克隆的引擎无法在配音或固定声音批量任务中保留参考说话人,VoiceStudio 会拒绝这些任务而不是静默切换引擎。

四、11 个 ASR 引擎

语音转文本方面,VoiceStudio 集成了 11 个引擎:

引擎语言适用场景
WhisperX(默认)~100配音、字幕、词级时间戳
Faster-Whisper~100通用跨平台转录
Faster-Whisper(隔离)~100崩溃隔离的批量转录
MLX Whisper~100Apple Silicon 优化
PyTorch Whisper~100CUDA、MPS、CPU 回退
Parakeet TDT英语 + 25 欧盟语言快速 CPU/CUDA 转录
Parakeet TDT v3 (MLX)25 欧盟语言Apple Silicon 听写和词时间戳
Moonshine英语低功耗、低延迟 ONNX
FunASR50+VAD 和内联说话人分离
sherpa-onnx取决于模型流式 CPU 听写
OpenAI-compatible(远程)取决于服务器Qwen3-ASR 等兼容端点(音频离开本机)

WhisperX 和 Faster-Whisper 在高效 float16 不可用时会自动回退到 int8

五、本地优先架构

VoiceStudio 的技术栈清晰分层:

Tauri v2 桌面壳(Rust)
        │ IPC
React + Vite UI
        │ HTTP · SSE · WebSocket on localhost:3900
FastAPI 后端
        ├── TTS / ASR 引擎注册表
        ├── 配音 / 音频 / 长音频流水线
        ├── OpenAI 兼容 API 和 MCP Server
        └── SQLite + Alembic → omnivoice_data/
路径职责
桌面壳frontend/src-tauri/窗口生命周期、托盘、快捷键、更新器、sidecar 启动
前端frontend/src/React UI、Zustand 状态、API 和事件客户端、i18n
APIbackend/api/REST 路由、schema、认证边界、流式
核心服务backend/services/生成、配音、音频处理、持久化
引擎backend/engines/隔离的可选引擎适配器
工作节点backend/worker/认证的远程计算和任务传输
数据omnivoice_data/项目、声音、设置、日志、SQLite 状态

网络边界设计

  • 桌面端只与 localhost:3900 的回环后端通信
  • 回环 API 调用不需要服务器密钥,远程访问需要共享 PIN 或 API 密钥
  • 远程工作节点和 OpenAI 兼容 ASR 是 opt-in,UI 会标识音频何时离开本机
  • 分析功能默认关闭,启用后只发送白名单的、无内容的使用元数据——不发送文本、音频、文件名或项目

六、OpenAI 兼容 API 和 MCP

VoiceStudio 不只是一个桌面应用,它还是一个本地语音平台。后端提供了 OpenAI 兼容的音频 API,你可以把任何 OpenAI 兼容的音频客户端指向本地后端:

- base_url="https://api.openai.com/v1"
+ base_url="http://localhost:3900/v1"

支持的端点:

端点用途
POST /v1/audio/speechTTS,输出 mp3/opus/aac/flac/wav/pcm,用 voice 选择声音配置,model 选择引擎
POST /v1/audio/transcriptionsSTT,输出 json/text/verbose_json/srt/vtt
WS /v1/audio/transcriptions/stream实时 PCM/WebM 转录,支持部分、话语、会话最终事件
GET /v1/audio/voices列出本地声音配置和引擎
GET /.well-known/voicestudio-speech发现 HTTP、WebSocket、MCP、原生听写控制传输

Python 示例:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:3900/v1", api_key="local")

with client.audio.speech.with_streaming_response.create(
    model="tts-1",
    voice="<profile-id>",
    input="Made on my own hardware.",
    response_format="wav",
) as response:
    response.stream_to_file("speech.wav")

此外,VoiceStudio 还提供了 MCP Server,可以为 Claude Code、Cursor 等 MCP 客户端提供语音合成和转录工具。也可以通过 npx skills add debpalash/VoiceStudio 安装 Agent Skills。

七、安装与系统要求

安装:从 GitHub Releases 下载对应平台的安装包(macOS DMG、Windows MSI、Linux AppImage)。首次启动会创建托管的 Python 环境并下载默认模型,后续启动复用。

macOS 首次启动需要右键 → 打开 进行一次批准。

从源码运行

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

系统要求

最低推荐
操作系统Windows 10 x64 / macOS 13.3 Apple Silicon / Linux glibc 2.39+当前支持的 OS 版本
内存8 GB16 GB+
磁盘10 GB 可用20 GB+ SSD
GPU可选,支持 CPU 模式NVIDIA CUDA 或 Apple Silicon
显存使用 GPU 时 4 GB8 GB+,大型可选引擎需要更多

计算支持:CUDA、Apple Silicon MPS/MLX、ROCm(仅 Linux,opt-in)、CPU、可选远程工作节点。VRAM 不足时会自动卸载到 CPU。

八、与云语音服务的对比

维度VoiceStudio典型云语音服务(如 ElevenLabs)
最佳适用隐私、离线、自托管、高批量快速上手,无需本地模型管理
数据路径默认本地,远程功能 opt-in音频和文本由服务商处理
成本模式免费软件,自己提供硬件订阅、积分或计量 API
设置安装应用和模型权重创建账户,使用 Web 应用或 API
性能取决于引擎和硬件服务商管理计算和扩展
离线使用模型安装后可以通常需要网络连接
定制化源码、引擎、模型、API、路由全开放限于服务商选项
维护自己管理更新、磁盘和计算服务商管理基础设施

简单说,云服务适合"快速上手、不想管硬件",VoiceStudio 适合"数据要留在本地、想要更多控制和定制"。

九、适用场景与局限

适用场景:

  • 隐私敏感的语音处理:内部会议录音、客户数据、医疗音频等不能上传到云端的场景
  • 有声书和播客制作:多角色脚本、EPUB/PDF 导入、章节渲染、.m4b 导出
  • 视频配音和字幕:完整的转录 → 翻译 → 配音流水线,保留说话人
  • 开发者本地语音 API:OpenAI 兼容的本地 TTS/ASR API,适合开发和测试
  • AI Agent 语音能力:通过 MCP Server 或 Agent Skills 为 Claude Code、Cursor 等提供语音能力
  • 语言学习和方言研究:646 种语言目录,支持多种方言
  • 批量音频处理:批量队列支持大量任务排队处理

局限:

  • 仍处于 Active Beta:建议用最新 Release 进行稳定工作,main 分支包含当前修复
  • 需要本地硬件:GPU 推理效果更好,CPU 模式可用但速度较慢
  • 模型下载需要网络:首次使用需要下载模型权重(之后可离线)
  • 引擎质量参差不齐:16 个 TTS 引擎的质量、语言覆盖和克隆能力差异较大,需要根据任务选择
  • AGPL-3.0 协议:应用本身是 AGPL-3.0,商业使用需要注意协议合规(各引擎模型有自己的许可证)
  • Intel Mac 不支持本地 Python 后端:需要使用远程后端

十、总结

VoiceStudio 代表了语音 AI 工具的一个重要方向:从"依赖云服务"到"本地优先、引擎可切换、API 开放"。

它不是一个单一的语音模型,而是一个统一的工作台,把业界 16 个 TTS 引擎和 11 个 ASR 引擎都集成进来,让用户可以根据任务、语言和硬件选择最合适的模型。同时,它提供了 OpenAI 兼容的本地 API 和 MCP Server,让开发者可以轻松地把语音能力集成到自己的应用和 AI Agent 中。

对于有隐私需求、想要更多控制、或者只是不想被云服务用量计量的用户,VoiceStudio 提供了一个功能完整、引擎丰富、完全本地的替代方案。1.5 万 Star 的热度也说明,这个方向有大量真实需求。

如果你正在做语音相关的工作,或者对本地 AI 工具感兴趣,不妨试试 VoiceStudio——在自己的硬件上运行语音克隆、配音和听写,数据完全不出本机。

项目地址:https://github.com/debpalash/VoiceStudio

复制全文 生成海报 VoiceStudio 语音AI 本地部署

推荐文章

程序员茄子在线接单