REACTOR
Y03 Contamination & Saturation 机器与前沿 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ Y03 ]…

基准污染与饱和

题被吃进训练集,题本身也可能是坏的。

基准怎么造出来,Y17 拆过那条流水线。基准还有个残酷的生命周期:诞生,被当作目标,被优化到饱和(人人接近满分、失去区分度),贬值,被下一个基准取代。最隐蔽的加速器叫污染(contamination):基准的考题混进了模型的训练数据,模型不是学会了能力,是背过答案。后面三个侦探故事只围着两个问题转:题新不新,题对不对。

先给生命周期一组宏观读数。Stanford AI Index 2025 统计:2023 年才发布的三个基准 MMMU、GPQA、SWE-bench,一年之内分数分别飙升 18.8、48.9、67.3 个百分点,其中 SWE-bench(真实 GitHub 修 bug 任务)从 4.4% 冲到 71.7%。一年之内从「几乎全不会」到「大部分都会」,要么是智能爆炸,要么是尺子坏得飞快,后面的证据会告诉你水分不少。另一头,MMLU、GSM8K、HumanEval 这些老基准已普遍饱和在 88% 以上,对前沿模型失去区分度。合起来读,一把尺子越被当作目标,报废得越快。这正是反应性的宏观指纹。

第一个侦探故事:新题重考。Scale AI 的 GSM1k 按 GSM8K(最常用的小学数学题库)的风格、难度、解题步数,重新命制一千道全新的题,请各家模型重考。结果 Phi 与 Mistral 家族系统性掉分 8% 到 13%,也就是原先分数里有一成上下是背出来的。更妙的是取证环节:模型「能逐词吐出一道 GSM8K 原题」的概率,与掉分幅度正相关(Spearman r² 约 0.36)——越像背过原题,新题上掉得越狠。这个 r² 换算过来,背题解释了掉分的三分之一强。同年还有一篇故意荒诞的讽刺论文:Schaeffer 训练了一个一百万参数的迷你模型 phi-CTNL(连起来读作 fictional,虚构),在众多学术基准上拿到满分,秘诀只有一个,训练数据就是各基准的测试集本身。靶子是不做污染排查就宣布 SOTA 的发布会文化。Apple 的 GSM-Symbolic 把切口再推深一层:不碰原题,只把题目里的数值换掉,多数模型就显著下滑。这说明被背下的不只是题面,还有题型模板本身。

FIG.01 基准饱和与污染简史 TIMELINE

第二个侦探故事:查「标准答案」本身。饱和的另一半原因不在模型,在题。MMLU-Redux 请人重标了 5700 道 MMLU 题,估出 6.49% 的题目本身有错:答案标错、题干残缺、不止一个正解。这个比例说明什么?6.49% 的题本身有错,模型就算把该会的全答对,能拿的分也顶多是 100% 减掉这部分——这就是为什么准确率的物理上限被钉死在 93.5% 附近,一个把该会的全会了的模型也只能考到这里。换个角度看,「能力饱和」至少有一部分,其实是撞上了错题天花板;而且清洗错题后模型排名会变,原榜单部分是被错题噪声搅乱的。这不是 MMLU 独有:号称精修的 MMLU-Pro 仍查出约 4% 错题与另外约 5% 的生成、标注、答案抽取问题;一项 Text-to-SQL 审计更发现 121 道开源标准答案里 66.1% 标注有误,三分之二的「标准答案」自己就是错的。基准出错是跨领域的系统性现象,「更难」不等于「更干净」。

「饱和在加速」的流行叙事也要打个折。Akhtar 与 Reuel 等人 2026 年系统分析 60 个主流基准:饱和比例从发布不满 24 个月的 42.9% 升到超过 60 个月的 54.5%,随年龄上升但相当温和。这与 AI Index 那组单点飙升并不矛盾:前者是全体基准的长期趋势,后者是个别新基准的初期陡升,混起来读就会夸大恐慌。同一研究里最反直觉的一条:公开测试集与私有测试集的饱和率无统计学差异。藏题防得住逐字泄漏,防不住饱和本身,因为饱和还有别的来源:题目质量、测试强度、答案可猜性。

第三个侦探故事:SWE-bench 三代崩坏。第一代:审计发现 32.67% 的「成功」补丁涉及答案泄漏,修复方案就写在 GitHub issue 的评论里,模型照抄即可,接近三分之一的成功是抄来的;把泄漏题与弱测试题清洗之后,SWE-Agent 加 GPT-4 的解决率从 12.47% 跌到 3.97%,挤掉水分后成绩只剩三分之一。第二代 Verified 是人工校验版,又被 OpenAI 查出至少 16.4% 任务有缺陷、最难的 138 题约 59% 损坏、模型能逐词复现人类的原始补丁,2026 年被弃用。第三代 Pro 不到一年也被审计出约 30% 损坏并被撤回推荐,期间顶尖模型通过率 8 个月从 23.3% 飙到 80.3%。三代的可用周期一代比一代短。病根在材料:GitHub issue 是为人类协作生产的,解答会写在评论里,测试本来就不为拦截 AI 而设计,从这种材料里造基准,缺陷是继承来的。OpenAI 给出的方向是请资深工程师专为 AI 评测从零设计任务,代价是昂贵且难以规模化。

agentic 评测还多出一个静态基准没有的作弊面:环境本身。agent 可以用普通的 git 命令翻看仓库历史,从未来的 commit 里直接捞出官方修复,这条路没人堵过,最近的出口就在那里(这类「堵一个洞、旁边就是下一个洞」的机制在 Y05 有正式名字;agent 评测的系统处理在 Y14)。取证侧的困境(为什么事后检测靠不住)在 Y13 单独展开,防御侧的时间切分与留出设计在 G03

造一批短期刷不爆的题,是另一条对策线,结果演示了一种全新的失效。Humanity's Last Exam 收 2500 道跨学科前沿难题,顶级系统起初只拿约 8.8%,但作者自己预测这个数字撑不了多久。FrontierMath 请职业数学家命制未发表的原创难题,SOTA 起初不到 2%,看起来是终极防污染设计。然后 2025 年 1 月媒体披露:这个以「未见题」为卖点的基准由 OpenAI 资助,付费命题的数学家事先不知情,OpenAI 拿到对绝大多数最难题目及解答的独家访问权,并用它宣布 o3 拿下 25%(前代仅 2%);Epoch 承认透明度有错,称双方有口头约定不拿题目训练。教训一句话:技术上的抗污染设计再精巧,只要出题方与被测方之间存在资金与数据访问的不对称,「模型没见过题」这句保证本身就成了待审计的对象。这不再是统计问题,是治理问题,评测治理这条线在 Y15G06 继续。

留一个问题:如果 n-gram 失效、MIA 失效、语义检测又能被规避,那「证明某个分数是干净的」在原则上还可能吗?D4 报告认为这把污染问题推向了和自适应过拟合(Y02:反复用同一套题做选择也会透支它)同样的处境:最坏情况不可判定,只能靠制度设计(held-out、时间切分、审计)而不是事后检测。

一句话带走:读任何跑分先问两句,题新不新、题对不对;这两问答不上来,分数只是一段公关文案。

来源 / 延伸阅读
  • Zhang et al. (2024). GSM1k, arXiv:2405.00332;Mirzadeh et al. (2025). GSM-Symbolic, arXiv:2410.05229(NoOp 掉分至 65%);Schaeffer (2023). phi-CTNL 讽刺文, arXiv:2309.08632。
  • Gema et al. (2025). "Are We Done with MMLU?"(MMLU-Redux,6.49% 错题);Wang et al. (2024). MMLU-Pro, arXiv:2406.01574。
  • Aleithan et al. (2024). SWE-bench+, arXiv:2410.06992;OpenAI (2026). "Why We No Longer Evaluate SWE-bench Verified" 与 "Separating Signal from Noise"(Pro 约 30% 损坏)。
  • Schaeffer et al. (2026). 污染悖论, arXiv:2601.04301;Meeus et al. (2025). "MIA Are Rushing Nowhere";Dekoninck et al. (2024). 规避检测, arXiv:2402.02823。
  • Jain et al. (2024). LiveCodeBench, arXiv:2403.07974;White et al. (2024). LiveBench, arXiv:2406.19314;Kiela et al. (2021). Dynabench, arXiv:2104.14337。
  • Humanity's Last Exam (2025). arXiv:2501.14249;Glazer et al. (2024). FrontierMath, arXiv:2411.04872(OpenAI 资助争议:TechCrunch 2025-01)。
  • Stanford AI Index 2025(饱和加速读数);Akhtar, Reuel et al. (2026). 饱和系统研究, arXiv:2602.16763(藏题无效;2026 编号引用前请复核)。深化见 research/deep/D4 §2–3、§5。
接下来去哪