程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
语音识别 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
WechatSI 语音插件接入:AppID、app.json 配置与 5 个常见报错
代码
WechatSI 语音插件接入:AppID、app.json 配置与 5 个常见报错
2026-09-17 22:43:15
记录小程序 WechatSI(微信同声传译)插件的接入流程:后台添加插件、app.json 声明、语音识别与合成代码,以及插件未授权、真机无声、合成超时、流式朗读乱播、配额超限 5 个常见问题,另附 Vant Weapp、ECharts、腾讯地图、dayjs 等常用插件。
微信小程序
WechatSI
语音识别
语音合成
小程序插件
FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一
资讯
FireRedAudio 开源:小红书把音频理解和生成塞进同一个 9B 模型,六项能力全榜单第一
2026-09-12 09:57:11
FireRedAudio 是小红书超级智能团队开源的统一音频语言模型:9B LLM 骨架配 Audio Encoder(理解)与 RedAE(生成)双通路,一个模型同时支持 ASR、音频理解问答(MMAU 82.0/MMSU 83.3 双第一)、1 小时长录音结构化分析、零样本声音克隆(Seed-ZH CER 0.83%)、自然语言声音设计与语义/声学级语音编辑;论文 arXiv 2608.24168,HuggingFace/ModelScope 均可下载。
FireRedAudio
音频大模型
语音识别
TTS
小红书
SoulX-Transcriber 开源:端到端多人对话转录,社交对话场景 DER 低至 1.32%
资讯
SoulX-Transcriber 开源:端到端多人对话转录,社交对话场景 DER 低至 1.32%
2026-09-12 09:53:16
SoulX-Transcriber 是 Soul App 联合西北工业大学 ASLP@NPU 与 Moonstep AI 开源的端到端多人对话转录模型:统一框架直接输出带时间戳、说话人身份与文本的结构化结果,处理重叠发言、快速切换、同性别混淆更自然;在 AISHELL-4、AliMeeting 等基准大幅超越 Gemini 3.1 Pro 等闭源模型,社交对话场景 DER 低至 1.32%。
SoulX-Transcriber
语音识别
多人对话
端到端
Soul
faster-whisper:Whisper 推理提速 4 倍、显存砍半的 CTranslate2 实现
编程
faster-whisper:Whisper 推理提速 4 倍、显存砍半的 CTranslate2 实现
2026-09-12 09:46:57
faster-whisper 基于 CTranslate2 重写 OpenAI Whisper 推理引擎:13 分钟音频转写从 2 分 23 秒降到 59 秒(批量模式 16 秒),显存占用降低约 38%,内置 Silero VAD 防幻觉,API 与官方版几乎一致,迁移只需改几行代码。
faster-whisper
Whisper
语音识别
CTranslate2
量化
减少 Whisper 幻觉转写:推理时的幻觉空间低秩投影
编程
减少 Whisper 幻觉转写:推理时的幻觉空间低秩投影
2026-09-07 12:13:58
arXiv 新研究:从非语音校准数据估计幻觉关联子空间,推理时把解码器隐藏状态投影远离该子空间。非语音基准幻觉率从 31.31% 降到 2.44%(相对降 92%),无需重训、可叠加现有部署。
AI
语音识别
Whisper
论文
Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp、Granite Speech 5.0 与 Step-3.7-Flash 支持
资讯
Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp、Granite Speech 5.0 与 Step-3.7-Flash 支持
2026-09-07 03:11:58
Hugging Face Transformers v5.16.0 发布:新增 Qwen4-Exp(线性+稀疏注意力混合架构)、Granite Speech 5.0 Turbo CTC(4.7 亿参数轻量 ASR)和 Step-3.7-Flash(198B 稀疏 MoE 视觉语言模型)支持,共 114 个提交。
HuggingFace
Transformers
Qwen4
语音识别
MoE
大模型
视觉语言模型
Moonshine 深度解剖:比 Whisper 快 5 倍的端侧语音识别引擎——变长音频、卷积前端、RoPE 与实时流式 ASR 工程实战
编程
Moonshine 深度解剖:比 Whisper 快 5 倍的端侧语音识别引擎——变长音频、卷积前端、RoPE 与实时流式 ASR 工程实战
2026-07-26 01:44:11
深度拆解 Moonshine 端侧语音识别引擎:为何扔掉梅尔频谱与30秒定长、直接吃原始波形按变长计算,配合卷积前端与RoPE做到比Whisper快5倍、体积仅27MB。含Python/ONNX推理、Silero VAD实时流式管线、int8量化与端侧部署优化Checklist。
Moonshine
语音识别
ASR
端侧AI
Whisper
流式识别
ONNX
RoPE
模型量化
边缘计算
Moonshine 深度解剖:27M 参数挑战 Whisper——可变长度推理、RoPE 与毫秒级流式延迟的边缘 ASR 工程真相
编程
Moonshine 深度解剖:27M 参数挑战 Whisper——可变长度推理、RoPE 与毫秒级流式延迟的边缘 ASR 工程真相
2026-07-25 13:44:10
深度拆解 Moonshine 边缘端语音识别模型:可变长度推理如何免除 Whisper 的 30 秒填充税、RoPE 与卷积波形前端的架构决策、34ms 流式延迟原理,附 Python/ONNX/浏览器三条部署路线与量化调优实战。
Moonshine
语音识别
ASR
Whisper
边缘计算
RoPE
ONNX
INT8量化
流式识别
开源
本地优先的 AI 会议助手工程实战:从实时流式 ASR 到零云端 LLM 摘要全链路拆解
编程
本地优先的 AI 会议助手工程实战:从实时流式 ASR 到零云端 LLM 摘要全链路拆解
2026-07-10 04:42:09
以 GitHub Trending 榜首 Meetily 为引,从零手搓本地优先的 AI 会议助手:麦克风采集、Silero VAD 切句、faster-whisper 流式转写、pyannote 说话人分离、Ollama 本地 LLM 摘要,含可运行代码与量化/延迟/内存优化。
本地AI
会议助手
语音识别
Whisper
Ollama
隐私计算
实时转录
零成本在本地跑 Whisper:从视频自动生成双语字幕
编程
零成本在本地跑 Whisper:从视频自动生成双语字幕
2026-06-08 15:48:58
详解 whisper_v3 项目核心代码:用 Faster-Whisper 从视频自动生成带时间戳的 SRT 字幕,配合 DeepSeek API 翻译,全程跑在本地 RTX 5060 Ti 上,零成本隐私友好。
Whisper
语音识别
Faster-Whisper
Python
SRT字幕
VibeVoice 深度解析:微软开源语音AI全家桶——从7.5Hz超低帧率到Next-Token Diffusion的技术革命
编程
VibeVoice 深度解析:微软开源语音AI全家桶——从7.5Hz超低帧率到Next-Token Diffusion的技术革命
2026-05-17 18:16:11
微软开源的VibeVoice通过7.5Hz超低帧率连续语音分词器和Next-Token Diffusion框架,实现了60分钟长音频识别、90分钟多角色语音合成、300ms实时流式TTS三大突破,被ICLR 2026接收为Oral论文。
AI语音
语音识别
语音合成
开源项目
微软
Insanely Fast Whisper 深度解析:比原版快 10 倍的语音转文字引擎——从原理到生产级部署的完整实战
编程
Insanely Fast Whisper 深度解析:比原版快 10 倍的语音转文字引擎——从原理到生产级部署的完整实战
2026-04-29 16:24:38
深入解析Insanely Fast Whisper的优化原理、代码实战与生产部署,比原版Whisper快10倍的语音转文字方案
AI
语音识别
Whisper
Insanely Fast Whisper
VibeVoice 深度解析:微软 45K Star 开源语音 AI,重新定义长音频处理范式
编程
VibeVoice 深度解析:微软 45K Star 开源语音 AI,重新定义长音频处理范式
2026-04-29 11:11:12
深度解析微软开源语音AI框架VibeVoice:60分钟单次ASR、90分钟多说话人TTS、200ms实时语音合成,7.5Hz超低帧率Tokenizer+Next-Token Diffusion架构,45K Star项目技术全解析
VibeVoice
语音AI
ASR
TTS
微软
开源
深度学习
语音识别
语音合成
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串
编程
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串
2024-11-19 04:26:54
Pynini是一个开源的Python库,专注于构建语言模型和处理字符串,利用有限状态转换器(FST)实现高效的字符串匹配和转换。它提供丰富的操作符和函数,易于与其他NLP工具集成。Pynini可用于语音识别、拼写检查和词性标注等多个领域,适合处理复杂的语言结构。
编程
自然语言处理
开源工具
机器学习
语音识别
Vosk-API 是一款开源的离线语音识别工具包
综合
Vosk-API 是一款开源的离线语音识别工具包
2024-11-19 07:51:49
Vosk-API是一款开源的离线语音识别工具包,支持多种编程语言和超过20种语言,提供准确可靠的语音识别服务。其特点包括轻量级模型、零延迟响应和可重构词汇量,适用于聊天机器人、智能家居设备等多种场景。Vosk-API适合在各种设备上使用,从小型设备到大型集群均可扩展。
语音识别
开源工具
技术支持
Vosk-API
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调