本地 TTS 工具 Abogen:EPUB/PDF 转带字幕音频
Abogen 是一个基于 Python 的桌面级本地 TTS 工具,采用 MIT 许可证,目前 GitHub 星标超过 6,000。名称是 "Audiobook Generator" 的缩写,目标很直接:把 EPUB、PDF、Markdown 或纯文本文档在几秒内转成带时间同步字幕的音频,全程在本地运行,不依赖云端 AI 大模型。
项目地址:https://github.com/denizsafak/abogen
适合的场景包括电子书转有声读物、给社交媒体内容配音、批量处理培训材料。
核心功能
多格式文档导入:支持 EPUB、PDF、Markdown、TXT 等格式,能解析电子书目录,自动按章节分割生成有声读物。
Kokoro-82M TTS 引擎:集成 HuggingFace 上的 Kokoro-82M 神经语音模型,提供 66+ 种语音,覆盖英语、中文、日语、法语、西班牙语等 9 种语言。
字幕生成:支持单词级、句子级等多种字幕分割模式,自动生成与音频同步的字幕文件,可用于双语教学或字幕视频。
音色混合器(VoiceMixer):按权重混合多种基础语音,组合出新的合成音色。
批量队列处理:内置任务队列,支持多文件按顺序自动处理,任务配置可独立保存。
GPU 硬件加速:基于 PyTorch,支持 NVIDIA CUDA、Apple MPS(M 芯片)及 AMD ROCm 加速。
安装
前置要求:需要先安装 eSpeak-NG 语音合成后端。
- Windows:访问 https://github.com/espeak-ng/espeak-ng/releases/latest 下载并运行
*.msi文件。 - macOS:
brew install espeak-ng - Linux (Ubuntu/Debian):
sudo apt install espeak-ng
三种安装路径:
路径一:Windows 一键安装
克隆仓库后双击 WINDOWS_INSTALL.bat,脚本会自动下载 Python 环境、CUDA 依赖等组件。
路径二:uv 包管理器(推荐)
uv tool install --python 3.12 abogen
路径三:pip
pip install abogen
安装完成后,终端输入 abogen 启动图形界面。
图形界面操作流程
- 启动应用:双击桌面图标,或在命令行运行
abogen。 - 导入文件:点击 "Open upload & settings",把 EPUB、PDF 或 TXT 文件拖入上传区域。
- 配置参数:选择语音、语速(建议 0.8–1.2 倍速)、输出格式(MP3/WAV/FLAC/M4B 等),勾选 "Generate subtitles"。
- 开始合成:点击 "Start",等待进度条结束。
实测约 700 字的文档,在核显环境下约 40 秒生成音频;配备 NVIDIA 显卡并配置好 CUDA 后,速度还能提升 3–5 倍。多个文档可全部加入任务队列,勾选 "Override item settings" 后用同一套全局配置批量处理。
与其他方案对比
| 对比维度 | Abogen(开源本地 TTS) | Edge 大声朗读(浏览器内置) | ElevenLabs / Azure TTS(云端商业服务) |
|---|---|---|---|
| 运行模式 | 完全本地/离线,数据不上传云端 | 本地+云端混合,依赖联网 | 云端 API,需网络且数据上传 |
| 语音质量 | 神经网络 TTS,66+ 语音,自然度高 | 基础 TTS,语音选择有限 | 自然度高,支持情感和实时克隆 |
| 成本 | 完全免费(MIT 开源) | 免费 | 按字符/时长收费,企业版本昂贵 |
| 字幕生成 | 原生支持,与音频自动同步 | 不支持 | 部分支持,大多需额外开发 |
| 适用场景 | 内容创作者、教育者、注重隐私的开发者 | 日常浏览器阅读 | 企业级/商业应用,对音质要求极高 |
| 扩展性 | 高,可二次开发,集成音色混合器 | 低 | 中等,提供 API |
小结
追求语音拟人度且预算充足时,云端商业服务是选择之一;看重隐私、零成本、离线可用和字幕自动生成,Abogen 是当前开源生态里比较完整的方案。批处理能力和音色混合对内容创作者的生产流程帮助明显。
项目维护较活跃,近几个月连续发布 v1.3.1 等多个版本,持续优化性能与修复问题。对于开发者,它基于 PyQt5/PyQt6 和 Kokoro-82M 的模块化架构,也可以作为学习现代 TTS 应用实践的参考。
项目地址:https://github.com/denizsafak/abogen