编程 当裁判无法裁决:LLM 评测里被跳过的无法判定桶

2026-09-08 04:10:35

当裁判无法裁决:LLM 评测里那个被跳过的"无法判定"桶

CauterRule 是一个开源 sidecar:从 agent 的反复失败中学习常驻规则(extract → replay-test → promote),试着把可复用的指导从噪音般的过度泛化里分离出来。v0.1.0 已发布(GitHub 与 PyPI,pip install cauterule,含 CLI、MCP server、7 种导出格式和内置 git 规则包)。现场测试报告评估 4 个模型、394 条轨迹。

核心发现:多数结果是"无法判定"

每个 benchmark 都有三个桶:pass、fail、inconclusive。多数人只看前两个。CauterRule 的现场测试里,第三个桶比前两个加起来还大——而且它最重要。

全部 4 模型、1538 个候选的分布:

判定数量占比
Pass36523.7%
Fail35923.3%
Inconclusive81452.9%

一半以上的结果是"也许"——回放引擎既没通过也没拒绝候选。这不是边缘桶,是输出的大多数,也是大多数 benchmark 报告干脆跳过的部分:pass 是胜利、fail 是损失、inconclusive 是尴尬——意味着你的评测工具没干成活。但忽略 inconclusive 桶 = 忽略一半以上数据,而且很可能从留下的一半里得出错误结论。

模型间的意外差异

模型候选Inconclusive占比
Local Llama 3.2B37918949.9%
Local Qwen 4B37320956.0%
Cloud GPT-4o-mini39424862.9%
Cloud Llama 3.1 8B39216842.9%

最强的云模型(Llama 3.1 8B)inconclusive 率最低(42.9%)——更好的抽取产生更具体的触发器,更容易被回放引擎验证。但付费云模型 GPT-4o-mini 的 inconclusive 率最高(62.9%),超过两个本地模型。 只看 pass 数它和本地模型差不多(77 vs 72 vs 93);看 inconclusive 率它是最优柔寡断的。这不是说 4o-mini 是坏模型——它产生的是回放引擎无法评估的候选。输出不是更差,是更难打分——不同的失败,指向不同的修复。

实践建议

  • 评测报告永远带上 inconclusive 桶,跳过它就是忽略大多数数据;
  • 模型对比别只看 pass/fail:高 inconclusive 率("难以打分")与低正确率是不同问题;
  • agent 失败学习类工具要区分"提取质量"与"验证能力"——回放引擎判不了的候选,先修可评分性。

来源:When Your Judge Can't Decide - DEV Community

复制全文 生成海报 AI 评测 开源 agent

推荐文章

程序员茄子在线接单