编程 Parlor:本地端到端语音视觉 AI 助手,M3 Pro 即可实时运行

2026-09-05 19:00:05

Parlor:本地端到端语音视觉 AI 助手,M3 Pro 即可实时运行

OpenAI 几年前演示的那个指着物体对话的语音 AI,你觉得什么时候能在自己电脑上跑起来?我原本以为还得等几年,或者至少得有一张 RTX 4090。

结果最近在 GitHub 看到一个项目,直接在 MacBook 上就实现了——只要打开浏览器,对着麦克风说话,摄像头拍着画面,AI 实时理解并语音回复。关键是完全跑在本地,不需要云端,不需要 API Key,不需要订阅。

这个项目叫 Parlor,来自印尼开发者 Fikri Karim,9 天冲到 1.5K Star。

一句话说清楚:Parlor 是一个端到端的本地语音视觉 AI 助手,用 Gemma 4 E2B(专门给本地设备做的小模型,语音、图片、文字全能处理)做语音和视觉理解,用 Kokoro 做语音合成,在 Apple Silicon 或 Linux GPU 上实现实时对话。

解决的痛点

它要解决两个很具体的痛点:成本和隐私。

想用 OpenAI 的 GPT-4o Voice Mode?得付 20 美元/月,而且对话数据会上传云端。想用 Siri 或 Google Assistant?免费,但同样要上传数据,而且功能有限。Parlor 的思路是把所有计算搬到本地,没有服务器成本,没有数据泄露风险,没有订阅门槛。

开发者之前做了个叫 bule.ai 的免费英语口语练习平台,已有数百月活用户。他一直在思考怎么保持免费且可持续,答案就是把算力从云端搬到用户设备上。6 个月前作者还要靠 RTX 5090 显卡才能让语音模型实时跑起来,现在一个 M3 Pro 芯片就够了。

核心能力

多模态融合:你一边说话摄像头能同步拍画面,AI 可以同时听懂你的话、看懂你指的东西。比如你指着桌上的水果问"这个怎么吃",它能结合你说的话和看到的画面直接回答。技术上就是浏览器先把声音和画面录下来,通过 WebSocket 传到本地服务器,再用 Gemma 4 E2B 一起处理。

随时打断:以前用语音助手必须等它把话说完你才能开口,现在用 Parlor 可以随时打断。AI 正在回复的时候,你一说话它立马停住,专心听你讲,对话特别自然。

整句语音合成,边说边播:它会把回复拆成一句一句来生成语音,不用等整段话都做完才开始播放,延迟感明显小很多。跑在苹果 M3 Pro 上,从头到尾的延迟大概 2-3 秒,虽然比云端方案慢一点,但日常用完全没问题。Gemma 4 支持多语言,可以在单次对话中混合使用。

社区反响

Parlor 在 Hacker News 上引发了讨论。有人说"feels like your demo should be a Siri demo",翻译一下就是这应该是 Siri 的演示。还有人提到一个真实场景:一直在找一个能在车间用的语音助手,戴着口罩手套没法解锁手机,"请先解锁你的 iPhone"在这种时候简直是灾难。这些讨论表明本地语音助手不是花里胡哨的技术,而是大家实际需要的。

安装步骤

运行平台推荐 macOS Apple(M1/M2/M3 芯片)或 Linux GPU,Windows 暂不支持。Python 版本必须用 3.12,3.13 或更高版本会安装失败,这个坑很多人踩过。安装过程还用到 git 和 uv 工具,注意提前安装。

克隆代码:

git clone https://github.com/fikrikarim/parlor.git

进入项目目录:

cd parlor/src

安装依赖:

uv sync

启动服务:

uv run server.py

第一次启动会自动下载模型,需要几分钟,下载完后就可以离线用了。看到终端显示服务启动成功后,打开浏览器访问 http://localhost:8000,授权摄像头和麦克风,就能开始对话了。

已知限制

Parlor 目前是 Research preview,官方说明是 Expect rough edges and bugs。几个已知限制:不支持 agentic coding(E2B 模型不适合代码代理任务);没有持久化对话历史,会话结束就丢失;不支持工具调用或 Function Calling。延迟方面,2-3 秒的端到端响应比云端方案慢,但对口语练习这类场景够用了。

Parlor 的意义不在于它有多强,而在于它展示了端侧 AI 的可能性。六个月前需要 RTX 5090,现在 M3 Pro 就够,再过一年可能手机就能跑。

项目地址:https://github.com/fikrikarim/parlor

推荐文章

程序员茄子在线接单