减少 Whisper 幻觉转写:推理时的幻觉空间低秩投影
Whisper 是广泛使用的语音识别(ASR)基础模型,但它的生成式解码器在输入几乎或完全没有语音时,会产生流畅的幻觉转写。一篇新的 arXiv 论文(2609.04561,cs.AI)提出无需训练、仅在推理时生效的方法来减少这类幻觉:对解码器激活做低秩投影。
方法
核心思路:从非语音校准数据中估计一个紧凑的"幻觉关联子空间",推理时把解码器隐藏状态向远离该子空间的方向投影。
作者评估了两种变体:
- always-on:对所有输入都应用投影;
- gated:仅当 Whisper 预测输入可能非语音时才应用。
结果
在非语音基准上,always-on 投影把平均幻觉率(HR)从 31.31% 降到 2.44%——相对降低 92.21%;gated 投影把 HR 降到 3.74%(相对降低 88.05%),同时更少误拒真实语音。在 LibriSpeech 上,gated 投影让绝对词错误率(WER)增加 0.33 到 4.39 个百分点,跨模型与数据集设置的误拒率(FRR)为 0.41% 到 9.97%。
这些结果表明,低秩激活投影能在不重训的情况下大幅压制 Whisper 幻觉,并在幻觉抑制与语音识别性能之间提供可控的权衡。
实践意义
对语音转写流水线的团队,这篇工作提供了几个直接可用的点:
- 幻觉问题常见于无语音/低语音输入(静音、纯音乐、嘈杂环境音被误当成说话),gated 模式用 Whisper 自身对非语音的预测做开关,尽量不伤真实语音的识别;
- 训练免、推理时方法意味着可以直接在现有 Whisper 部署上叠加,无需微调或额外模型权重;
- 权衡可控:追求极限去幻觉选 always-on(WER 代价更大),生产语音为主的场景选 gated(幻觉率仍降 88% 但 WER 增加有限)。
需要注意论文给出的数字来自其基准设置:always-on 对真实语音的误拒代价更高,实际接入前应在自己的语音分布上做一次小规模评估,确定 gated 的阈值设置。论文没有披露公开代码仓库,复现需按论文描述实现校准子空间估计。
来源:Reducing Hallucinated Transcripts in Whisper via Hallucination Space Projection - arXiv