REACTOR
Y17 How Benchmarks Get Made 机器与前沿 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ Y17 ]…

基准是怎么造出来的

每一张考卷背后都有人在赶工。

你在新闻里看到「某模型在某基准上刷到 90 分」,多半会默认这个 90 分像体温计读数一样客观。翻到考卷背面看看:一个 benchmark 要经过出题、找人标注、发布,被各家模型刷榜、饱和,最后悄悄退役,这一整条走下来,是有完整生命周期的产业流水线。流水线的每一环,都是人赶工完成的,人一赶工,就可能出错。看懂这条流水线,你再看任何一个基准分数,都会先问一句:这张卷子本身,干净吗,还量得动吗。

你在 Y01 学过,反复拿同一批题挑模型会过拟合到题的运气上。更上游的事是:那批题从哪来、由谁定对错。这也是 Y03 污染问题的地基,要先知道题是怎么造的,才谈得上题是怎么漏的。

先看出生。一个 benchmark 出生时就带着一个绕不开的原罪,叫建构效度问题。Raji 等 2021 年借心理测量学点破:像 ImageNet、GLUE 这种被宣称测「通用能力」的基准,其实只是特定数据、特定指标、特定标注实践的产物,它只能测它真正实例化的那个窄窄的构念。把它当「通用智能」的代理,本身就是一次效度谬误。说人话就是,一张卷子永远只考了它出的那些题,你却拿它的分数去谈一个宽得多的能力,这中间的缝,从出生那天就在。

接着是标注,也就是给每道题定一个标准答案,这一步最费人力,也最容易出错。这里有一个能把人镇住的数字:MMLU 是最主流的知识基准之一,可 2024 年的 MMLU-Redux 项目人工重标了其中 5700 道题、覆盖全部 57 个学科,估计约有 6.49% 的题目本身是错的,错标答案、题干残缺、或者好几个选项都对。这个 6.49% 说明什么:模型的准确率上限被这些错题死死钉在了 93.5% 附近,再强的模型也过不去,因为剩下那几个百分点的「正确答案」本身就是错的。你以为模型在冲刺满分撞上了能力天花板,其实它撞上的是标注天花板。而且这不是 MMLU 独有的毛病,有人审计一批开源的 Text-to-SQL 基准,发现 121 条标准答案里 66.1% 标错了,严重误估了模型能力。卷子出错,是跨领域的系统病。

过了出生和标注,benchmark 进入它最风光也最短命的一段:发布、上榜、被刷。这里的宏观指纹是有效寿命越来越短。斯坦福 AI Index 2025 给了组扎眼的数:2023 年推出的 MMMU、GPQA、SWE-bench,仅仅一年后分数就分别飙升了 18.8、48.9、67.3 个百分点。这说明什么:一个基准从「能区分前沿模型」到「大家都快满分、分不出高下」的窗口,正被压缩到以月计。可这里也要给一个流行的强叙事打折。「饱和越来越快」听着吓人,但 Akhtar、Reuel 等 2026 年系统分析了 60 个主流基准,把饱和定义为「顶尖模型间失去可统计区分的分辨力」,结果是饱和比例从发布不到两年的 42.9% 升到超过五年的 54.5%,随年龄上升,可趋势被作者形容为温和而非陡增。更反直觉的一条:公开测试集和私有藏起来的测试集,饱和率没有统计上的差别。也就是说,把题藏起来并不能阻止它饱和。个别新基准初期的陡升,和全体基准的长期温和趋势,是两回事,别混着吓自己。

生命的最后一站是退役,而退役往往不体面。编程基准 SWE-bench 的整条弧线就是一部标本级的死亡记录。原版让模型去解真实的 GitHub issue,一度是黄金标准;很快被查出问题,于是有了人工筛过的干净版 Verified。可 2026 年 OpenAI 自己宣布不再用 Verified,理由是至少 16.4% 的任务测试本身有毛病,在最能拉开顶尖模型的最难 138 题里约 59% 是坏的,而且各家前沿模型几乎能一字不差背出人类当年写好的修复补丁,那是背答案不是推理。更早的审计还发现,原版里约 32.67% 的「成功」补丁其实是答案直接写在了 issue 描述或评论里。接着有人做了抗污染的升级版 Pro,藏了一部分题当私库,结果 2026 年一审,约 30% 的题是坏的,通过率八个月里从 23.3% 蹿到 80.3%,官方干脆撤回推荐。这条弧线说明什么:每修好一代都被刷爆,然后再造新版,而新版的寿命一代比一代短。造新基准的速度,正在追不上它被玩坏的速度。当然,退役不全是坏事,Dynabench 那类做法索性让人和模型对着造题、专挑当前模型会栽的样本,把题池变成活的,用持续换血来对冲短命。

留一个问题:如果任何大规模知识基准的错题率都有个天然下限(人工标注质量就那么高),那准确率的可测上限是不是本就卡在 95% 附近,「逼近 100%」的军备竞赛在测量学上是不是从一开始就是幻觉?如果是,那真正该比的也许不是谁分更高,而是谁在更干净、更没被污染的题上还站得住,这正好把话头递给 Y03 的污染。

一句话带走:基准是人赶工造出来的活物,会出错、会被刷爆、会退役,看分数之前先看这张卷子干不干净、还量不量得动。

来源 / 延伸阅读
  • Raji et al. (2021). "AI and the Everything in the Whole Wide World Benchmark." arXiv:2111.15366(建构效度批评)。
  • Gema et al. (2024/2025). "Are We Done with MMLU?" / MMLU-Redux, arXiv:2406.04127(6.49% 错题,5700 题重标);Wang et al. (2024). "MMLU-Pro." arXiv:2406.01574(残余错误剖析)。
  • Reuel et al. (2024). "BetterBench." arXiv:2411.12990(46 条最佳实践,24 基准多不报显著性/不可复现)。
  • Stanford AI Index 2025(MMMU/GPQA/SWE-bench 一年 +18.8/48.9/67.3);Kiela et al. (2021). "Dynabench." arXiv:2104.14337(人机回环动态造题)。
  • Akhtar, Reuel, Soni et al. (2026). "A Systematic Study of Benchmark Saturation." arXiv:2602.16763(饱和 42.9%→54.5% 温和;公开与私有无显著差异)。
  • Aleithan et al. (2024). "SWE-bench+." arXiv:2410.06992(32.67% solution leakage);OpenAI (2026). "Why We No Longer Evaluate SWE-bench Verified" 与 "Separating Signal from Noise in Coding Evaluations"(Verified 16.4%/59% 缺陷;Pro ~30% 损坏、通过率 23.3%→80.3%)。
  • 主源 research/05 §一、§二、§七与 research/deep/D4 子主线 3、5。
接下来去哪
继续往下探索