SmartSub(妙幕)开源:字幕生成翻译配音一条龙,6 大转写引擎 100% 本地处理
今天介绍一个开源工具:SmartSub,中文名"妙幕",是由开发者buxuku创建的开源 AI 字幕生成与多语言翻译桌面应用。
它的定位非常清晰:一站式解决音视频字幕从生成到翻译到合成的全流程。
项目的起源可以追溯到作者之前开发的命令行工具 VideoSubtitleGenerator。这个工具虽然功能扎实,但每次使用都得敲命令、调参数,流程割裂。随着 Whisper 模型的火爆和 AI 翻译能力的成熟,作者决定将这些能力整合进一个"傻瓜式"的桌面应用里,让字幕生成和翻译变得像拖拽文件一样简单。
目前,SmartSub 已在 GitHub 上收获了超过4.5k Star,版本迭代非常活跃——从最初的 v1.x 到现在的 v3.7.0,几乎每月都有更新。
最新版本不仅在字幕生成精度上持续优化,还扩展了配音、说话人识别、在线视频下载等功能,正在从一个"字幕工具"进化为"音视频本地化处理平台"。
核心亮点
🔥 亮点一:6 大转写引擎
SmartSub 内置了 6 种语音转写引擎:
•whisper.cpp:C++ 重写版 Whisper,纯本地、高性能
•faster-whisper:基于 CTranslate2 优化,速度更快
•FunASR:阿里达摩院开源,中文识别精度出色
•Qwen3-ASR:通义万相系列,v3.7.0 刚加入的新引擎
•FireRedASR:轻量级选项
•本地 Whisper CLI:如果你已经安装了 Whisper,可以直接调用
不同引擎各有所长:whisper.cpp 兼容性好,FunASR 对中文支持更优,Qwen3-ASR 在长语音识别中表现稳定。
用户可以根据自己的需求和硬件条件自由选择,也可以全部下载后逐一测试。
🌍 亮点二:多种翻译引擎接入
它几乎接入了市面上所有主流翻译服务:
传统翻译 API:百度翻译、火山引擎翻译、微软翻译器、DeepLX
AI 翻译引擎:Ollama(本地模型)、Deepseek、Azure OpenAI、DeerAPI、Gemini、SiliconFlow、通义千问、豆包、小牛、腾讯、讯飞……
更贴心的是,它支持自定义参数配置:不用改代码,直接在界面上就能调整模型参数、自定义 HTTP 头和请求体、实时验证配置,还能导出导入配置方便团队共享。
双语字幕也是它的一大杀招。勾选"双语字幕"选项,就能导出原文+译文对照的字幕文件,看外语片时体验直接拉满。
🔒 亮点三:100% 本地化处理
很多在线字幕工具要求你把视频上传到云端,不仅有隐私泄露的风险,对于动辄几个 G 的原始视频,上传本身就很耗时。
SmartSub 的所有计算都在你本地电脑上完成——语音识别在本地跑模型,翻译要么调本地的 Ollama,要么调 API,但视频文件本身绝不会离开你的硬盘。
⚡ 亮点四:硬件加速
SmartSub 支持两大硬件加速方案:
NVIDIA CUDA(Windows/Linux):应用内置了 GPU 加速包管理器,会自动检测你的显卡型号,推荐合适的 CUDA 版本(11.8.0 / 12.2.0 / 12.4.0 / 13.0.2),一键下载即可启用,不需要手动安装 CUDA Toolkit。
Apple Core ML(macOS M 系列芯片):从 v1.20.0 开始支持,M 系列芯片用户下载 arm64 版本即可自动启用 Core ML 加速,识别速度显著提升。
✏️ 亮点五:可视化校对
语音识别再准,也难免出现专有名词错误。SmartSub 内置了可视化校对面板:
• 播放视频的同时,字幕行自动同步定位
• 逐行修改文字、调整时间轴
• 支持 AI 自动优化,一键批量修正
• 新增 AI 字幕精修功能,语言转写更可控
• 支持参考文稿导入,高置信度匹配原稿对齐修正
这比用文本编辑器改字幕体验好太多了——相当于给你一个迷你版的 PR 界面,改完一处立即看到效果。
🎬 亮点六:字幕合成与配音一条龙
支持AI 配音与声音克隆,v3.7.0 进一步支持多角色配音和说话人识别:
• 支持为字幕生成配音音轨
• 声音克隆:上传一小段参考音频即可克隆音色
• 说话人识别:自动区分不同发言者并标注角色
• 按角色批量分配音色,单句也可单独覆盖
加上字幕烧录功能——支持硬字幕(直接烧录进画面)和软字幕(封装在容器内)两种方式,可以调整字体、字号、颜色,所见即所得。
还有隐藏彩蛋:内置在线视频下载器,粘贴 YTb 或 B站 链接,就能自动拉取源视频,不用再单独找下载工具了。
快速上手指南
第一步:下载安装
SmartSub 提供了多种安装方式:
方式一:Homebrew(macOS 推荐)
brew tap buxuku/smartsub
brew install --cask smartsub
方式二:直接下载安装包
前往 GitHub Releases[1]页面,根据你的系统选择对应版本:
| 系统 | 芯片 | 显卡 | 推荐版本 |
|---|---|---|---|
| Windows | x64 | CUDA >= 11.8 | windows-x64-cuda通用版 |
| Windows | x64 | 无 N 卡 | windows-x64-generic |
| macOS | Apple Silicon (M1/M2/M3) | - | mac-arm64 (自动启用 Core ML) |
| macOS | Intel | - | mac-x64 |
| Linux | x64 | CUDA | linux-x64-cuda版本 |
| 关于 macOS "应用已损坏"提示:如果首次打开时出现警告,在终端执行以下命令即可: |
sudo xattr -dr com.apple.quarantine /Applications/SmartSub.app
第二步:下载模型
首次启动后,应用会引导你下载语音识别模型。建议选择:
•M 系列芯片 + 64GB 内存:large-v3-turbo 或 large 模型
•M 系列芯片 + 32GB 内存:medium 或 small 模型
•Windows 无 N 卡:small 或 base 模型
•Windows 有 N 卡:large-v3-turbo 模型
如果模型下载失败,可以:
- 切换到"引擎与模型"页面
- 选择国内镜像源下载
- 或者手动下载模型文件,在"导入模型"处导入
第三步:配置翻译服务
打开"设置 → 翻译服务",选择你喜欢的翻译引擎:
推荐配置方案:
1.追求免费+本地:选择 Ollama,本地跑一个 LLM 模型即可,完全免费且隐私安全
2.追求质量+速度:选择 Deepseek 或 DeerAPI,注册获取 API Key,翻译质量高
3.追求稳定+低成本:选择百度翻译或火山引擎翻译,按调用量计费,稳定可靠
API Key 获取:
• 百度翻译:访问 https://fanyi-api.baidu.com/ 注册
• 火山引擎:访问 https://console.volcengine.com/ 注册
• Deepseek:访问 https://platform.deepseek.com/ 注册
第四步:开始使用
选择任务类型,拖入文件,设置参数,点击"开始任务"——就是这么简单。
写在最后
SmartSub 的价值在于,它把原本分散在多个工具、多个平台、甚至需要付费才能完成的字幕工作流——音视频转字幕 → 翻译 → 校对 → 合成 → 导出——全部整合到了一个本地运行的开源桌面应用中。
SmartSub(妙幕),让每一帧画面都能美妙地表达。
项目地址:https://github.com/buxuku/SmartSub
引用链接
[1]GitHub Releases:https://github.com/buxuku/SmartSub/releases