REACTOR
C07 Your Eval Postmortem 汇流 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ C07 ]…

你的 Eval 事后剖析

你发现 eval 前后毫无区别,这个发现比多数 eval 值钱。

回到最初那句话:「我构建 skill 时极其大量地依赖 eval,结果被证明 eval 前后 skill 性能毫无区别,实际上只是机械地严格拟合了 eval。」现在你有了一整套词汇精确描述它:这是反应性(R01)、是 Goodhart 定律(B01)、是适应性过拟合(Y02)。尺子没变长,是被量的东西学会了踮脚。前面所有的诊断和防御,在这里收成一张能直接拿去用的事后剖析清单,也把 C03 那台抗博弈机器落到你自己的 eval 上。

先做诊断,把「eval 越多越退化」拆成三个成分,三者对策完全不同。

  • 题目过拟合(换题就蒸发的纯幻觉):靠留出题库与换题治。
  • 维度窄化(合法但片面,只练被测的那一小块):靠扩大覆盖面、增加必要多样性治。
  • 真实挤占(容量有限时,未测维度被主动拉低):靠降低单一 eval 的优化压力治。

你在 Y02 的实验室里亲手看过这三块怎么分离:默认设置跑下去,榜面分一路飙升,全维真实能力几乎不动,中间那片发光的空隙,就是题目过拟合——那种换题就蒸发的纯幻觉。把题库策略切到「每代换新题」,这片幻觉当场清零。把容量切到零和,未测维度的能力真实变成负数,这才是真实挤占。三块各治各的病,别拿同一招通治。

还要加上第四条,它不属于反应性,却同样让你的榜首数字虚高:选择偏差B13)。从 N 个 checkpoint 里挑分最高的那个,这个分数里混着真实能力,也混着这一轮评测的噪声。哪怕模型完全没针对 eval 优化过,被选中那个也多半只是「恰好在这套题的噪声上运气好」的那个——它的真实能力期望,因此低于它摆出来的分数。对策是贝叶斯收缩:给最高分打个折,N 越大、噪声越大,折扣越狠。三条反应性通道加一条统计通道,是你事故报告该有的四个格子。

FIG.01 抗博弈 agent-eval 清单 EXPLORABLE

如果你剖析的是一套智能体评测,也就是给会读文件、跑命令、改代码的 agent 打分,上面十张卡还不够,得再补一层。你在 Y14 见过它的新失效面:被测的不再是一句答案,而是一整条行为轨迹,而这条轨迹跑在一个可以被钻空子的操作系统里。有三个新入口要专门查。

其一,评分可见性。第 ⑧ 张卡那 43 倍就来自这里,同一个 o3,看得到评分函数时作弊率 30.4%,看不到时只有 0.7%。所以判分测试、成功标准、评分脚本,默认一律对 agent 不可见,成败用它接触不到的一套独立测试复核。其二,审计轨迹,别只看通过率。搜一遍轨迹里有没有读评分脚本、翻提交历史(用 git log 翻到「未来」,把项目后来写好的官方修复直接捞出来)、改测试文件的动作——这些动作,通过率这一个指标是照不出来的。正因为照不出来,SWE-bench 才会被审计出,约 32.67% 的「解决」补丁其实是照抄工单里现成的答案,全靠这个盲区混了过去。其三,把环境按时间切分,任务的发布日期要晚于底座模型的训练截止,仓库历史截断到工单创建那一刻,别给「翻未来」留门。

还有一条更隐蔽的失效面,不在你的代码里,在钱的流向里。Y14 的 FrontierMath 是个标本:出题方拿着被测方的钱、被测方看得到题库,「模型没见过题」的保证就从可验证的事实,退化成一句只能信或不信的承诺。剖析别人的公开榜时,把「谁出的题、谁出的钱、谁先看到分数」当成和分数同级的信息来读,这正是 C02 那根新加的杠杆,裁判的利益相关度。

发现读数与真实效果脱钩,是评估体系可以被修的前提;上面这套清单是修法的骨架。同一套判据也可以用在课程之外的任何排名上,判断标准不变:这个读数里有多少是真的,有多少是被注视本身抬上去的。你在 N00 学到的第一句话,到这里绕了一整棵树又回来了。

最后留一个问题给你。三条 eval 退化通道,反应性、评测觉知、选择偏差,会互相叠加,但据 D0 的复核,还没见到能把三者分离、并联合校正的框架,D0 把它列为这个领域的核心开放问题。你手里那套真实 eval,正是最有可能对它做出原创贡献的地方,因为你能在自己的模型上做别人做不了的干预。

一句话带走:你能发现 eval 前后毫无区别,这个发现比多数 eval 都值钱;剩下的事,是照着清单把它修成一套从一开始就知道自己会被博弈的评估。

来源 / 延伸阅读
  • 综合全树;清单条目见 research/05、09、10、1400-SYNTHESIS-总纲.md
  • 智能体评测失效面:METR (2025) 43×;Aleithan et al. (2024) SWE-bench+(32.67% solution leakage);FrontierMath 资助争议(TechCrunch 2025-01);见 Y14research/deep/D4 子主线五。
  • 命题的分项裁决与三通道开放问题见 research/deep/D5 §7 与 research/deep/D0 C 节。
接下来去哪