综合 电子书转有声书:Abogen 本地 TTS,EPUB/PDF 转带字幕音频

2026-09-12 22:03:31

本地 TTS 工具 Abogen:EPUB/PDF 转带字幕音频

Abogen 是一个基于 Python 的桌面级本地 TTS 工具,采用 MIT 许可证,目前 GitHub 星标超过 6,000。名称是 "Audiobook Generator" 的缩写,目标很直接:把 EPUB、PDF、Markdown 或纯文本文档在几秒内转成带时间同步字幕的音频,全程在本地运行,不依赖云端 AI 大模型。

项目地址:https://github.com/denizsafak/abogen

适合的场景包括电子书转有声读物、给社交媒体内容配音、批量处理培训材料。

核心功能

多格式文档导入:支持 EPUB、PDF、Markdown、TXT 等格式,能解析电子书目录,自动按章节分割生成有声读物。

Kokoro-82M TTS 引擎:集成 HuggingFace 上的 Kokoro-82M 神经语音模型,提供 66+ 种语音,覆盖英语、中文、日语、法语、西班牙语等 9 种语言。

字幕生成:支持单词级、句子级等多种字幕分割模式,自动生成与音频同步的字幕文件,可用于双语教学或字幕视频。

音色混合器(VoiceMixer):按权重混合多种基础语音,组合出新的合成音色。

批量队列处理:内置任务队列,支持多文件按顺序自动处理,任务配置可独立保存。

GPU 硬件加速:基于 PyTorch,支持 NVIDIA CUDA、Apple MPS(M 芯片)及 AMD ROCm 加速。

安装

前置要求:需要先安装 eSpeak-NG 语音合成后端。

三种安装路径:

路径一:Windows 一键安装

克隆仓库后双击 WINDOWS_INSTALL.bat,脚本会自动下载 Python 环境、CUDA 依赖等组件。

路径二:uv 包管理器(推荐)

uv tool install --python 3.12 abogen

路径三:pip

pip install abogen

安装完成后,终端输入 abogen 启动图形界面。

图形界面操作流程

  1. 启动应用:双击桌面图标,或在命令行运行 abogen
  2. 导入文件:点击 "Open upload & settings",把 EPUB、PDF 或 TXT 文件拖入上传区域。
  3. 配置参数:选择语音、语速(建议 0.8–1.2 倍速)、输出格式(MP3/WAV/FLAC/M4B 等),勾选 "Generate subtitles"。
  4. 开始合成:点击 "Start",等待进度条结束。

实测约 700 字的文档,在核显环境下约 40 秒生成音频;配备 NVIDIA 显卡并配置好 CUDA 后,速度还能提升 3–5 倍。多个文档可全部加入任务队列,勾选 "Override item settings" 后用同一套全局配置批量处理。

与其他方案对比

对比维度Abogen(开源本地 TTS)Edge 大声朗读(浏览器内置)ElevenLabs / Azure TTS(云端商业服务)
运行模式完全本地/离线,数据不上传云端本地+云端混合,依赖联网云端 API,需网络且数据上传
语音质量神经网络 TTS,66+ 语音,自然度高基础 TTS,语音选择有限自然度高,支持情感和实时克隆
成本完全免费(MIT 开源)免费按字符/时长收费,企业版本昂贵
字幕生成原生支持,与音频自动同步不支持部分支持,大多需额外开发
适用场景内容创作者、教育者、注重隐私的开发者日常浏览器阅读企业级/商业应用,对音质要求极高
扩展性高,可二次开发,集成音色混合器中等,提供 API

小结

追求语音拟人度且预算充足时,云端商业服务是选择之一;看重隐私、零成本、离线可用和字幕自动生成,Abogen 是当前开源生态里比较完整的方案。批处理能力和音色混合对内容创作者的生产流程帮助明显。

项目维护较活跃,近几个月连续发布 v1.3.1 等多个版本,持续优化性能与修复问题。对于开发者,它基于 PyQt5/PyQt6 和 Kokoro-82M 的模块化架构,也可以作为学习现代 TTS 应用实践的参考。

项目地址:https://github.com/denizsafak/abogen

复制全文 生成海报 TTS 开源工具 本地部署 Python 有声书

推荐文章

程序员茄子在线接单