REACTOR
G03 Held-Out & Dynamic Benchmarks 防御与设计 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ G03 ]…

留出与动态评测

让优化循环永远追不上你的题库。

怎么让考题永远追不上作弊的人?核心就一招的三个变体:藏一批题不公开、只考「发布之后才出现」的新题、定期换题。先记住一个泼冷水的事实,藏题买来的是时间,不是免疫,它拖慢作弊,但挡不住。

你在 Y02 见过自适应过拟合:反复拿同一批题去比模型、挑最好的,挑着挑着就过拟合到这批题的运气上。Y03 又讲过污染:题漏进了训练集,分数量的就成了记忆而不是能力。这两件事,都靠同一条思路对付。

思路只有一条,让被考的一方没法提前知道、也没法背下要考什么。落地成三招,从软到硬:

  • 留一批私题:公开你考哪些维度、用什么方法,但留一批题从不公开、从不进任何训练和调参,只在最后打分时用一次。
  • 时间切分:只考模型训练截止日之后才出现的题。它没见过未来,就没法背。
  • 动态刷新:每隔一阵换一批新题,缩短任何一批题被摸透的窗口。

后两招长什么样,有现成的样板。有的基准每月换一批新题、用自动脚本客观打分,从设计上就让你没有一套固定的题可背;还有的干脆让人和模型对着造题,专挑当前模型会栽的刁钻样本,你刚补上一个弱点,它就再给你出一个。这类做法的共同点是把题池变成活的,而不是一份发布后就定死的名单。

顺带把背后的原理和一个反转说清。反复拿同一批题比模型、挑最好的,每挑一次都在悄悄泄漏信息——你是在用这批题的分数反过来调整选择,等于偷看了一眼底细。看的次数一多,你调整的方向就成了这批题恰好的运气而不是真本事,这就是过拟合,也是私题库为什么要严格隔离、绝不进这个反复挑选循环的原因。有人为公开榜设计过更聪明的机制,比如只在你的新成绩明显超过历史最好时才更新公开分,把每次泄漏的信息量卡到最小。不过要给恐慌打个折:有人复核了一百多场数据竞赛,发现这种过拟合弱得出奇,因为大家的模型高度相似,等于没做那么多次真正独立的尝试。所以在「反复重用同一批题」这件事上,理论很吓人、实测挺温和;真正的实锤发生在你死磕单一目标、还让模型看得见答案的时候。

三招都不新,可一落地就撞墙,编程测试 SWE-bench 的经历就是一部血泪史。原版出来后,有团队请人一道道审、做了个「干净版」。可后来一查,至少 16.4% 的题测试本身有毛病,在最能拉开顶尖模型的最难 138 题里,约 59% 是坏的,这说明人审过的干净基准也没那么干净。更糟的是,各家前沿模型几乎能一字不差背出人类当年写好的修复补丁,那是背答案,不是推理。接着有人做了抗污染的升级版,藏了一部分题当私题库,结果 2026 年一审,大约 30% 的题是坏的,通过率八个月里从 23.3% 蹿到 80.3%,官方干脆撤回了推荐。每修好一代都被刷爆,然后再造新的,而新版的寿命一代比一代短。

私题库还有个比污染更阴的漏洞:出题的人和被考的人之间,钱和「谁能看到题」不对等。有个用原创难题命制的数学基准 FrontierMath,本是抗污染的样板,起初模型只能做对不到 2%。后来媒体披露它由一家 AI 公司出资,而且这家公司能看到绝大多数最难的题和答案,六位付费出题的数学家事先都不知情,公司随后用它宣布自家模型拿了 25%。问题不在这个数字真假,而在于这道关系本身:出题方被被测方供养,还掌握谁能看题,这就已经不再是独立第三方。「它没见过这题」这层保证,原本靠的是出题人和被测模型互不知情、彼此隔离;独立性一旦没了,这道隔离也就形同虚设,保证就不再由技术决定,而由治理决定,这条接 G06

最后必须泼一盆冷水,别把藏题当银弹。2026 年一项研究扒了 60 个主流基准,发现题目越老越容易饱和,也就是顶尖模型之间分不出高下,从发布不到两年的 42.9% 升到超过五年的 54.5%,但涨得并不猛。真正扎心的是另一条:公开题库和私有藏题库,饱和的比例没有统计上的差别。也就是说,把题藏起来并不能阻止它饱和。藏题的作用是把「被摸透」的时间往后拖,给你争取换题、轮换的窗口,它买的是时间,不是免疫。真正的防线是把三招当成一条一直在转的流水线,而不是指望某一批藏起来的题永远干净。

设计 eval 时,照着这张清单走:

  • 留一批私题,只用于最终裁决,绝不进训练和调参回路。
  • 尽量用时间切分,优先收模型训练截止日之后才产生的真实任务。
  • 定期换题,给每套题记「服役时长」,到期轮换。
  • 主动做污染审计,把「答案能被一字不差背出」「换个选项顺序就掉分」的题作废。

留一个问题:前沿模型的高分里,污染到底占几成?有研究给了个反直觉的答案:一条泄漏的题进预训练,本该很致命。可后续拿海量新数据接着训,又会把它冲淡甚至抹掉。所以大模型经历海量训练后几乎不掉分,小模型掉得多。但我们至今没有一个跨基准、跨厂商的拆账,说清高分里多少是污染、多少是脚手架、多少是真本事。

一句话带走:藏题、时间切分、定期换题是一条要一直转的流水线;它买的是时间,不是免疫。

来源 / 延伸阅读
  • Blum, A. & Hardt, M. (2015). "The Ladder: A Reliable Leaderboard for Machine Learning Competitions." ICML, arXiv:1502.04585(只在显著超越时更新公开分)。
  • Dwork, Feldman, Hardt, Pitassi, Reingold & Roth (2015). "The reusable holdout." Science 349:636。
  • Roelofs, Shankar, Recht et al. (2019). "A Meta-Analysis of Overfitting in Machine Learning." NeurIPS;Mania et al. (2019). "Model Similarity Mitigates Test Set Overuse."(百场竞赛过拟合弱、模型相似性)。
  • OpenAI (2026). "Why We No Longer Evaluate SWE-bench Verified" 与 "Separating Signal from Noise in Coding Evaluations"(Verified 16.4%/59% 缺陷;Pro ~30% 损坏,撤回推荐)。
  • Glazer et al. (2024). FrontierMath, arXiv:2411.04872;OpenAI 资助与独家访问争议 — TechCrunch 2025-01-19。
  • Kiela et al. (2021). Dynabench;White et al. (2024). LiveBench;Jain et al. (2025). LiveCodeBench, arXiv:2403.07974(时间切分)。
  • Akhtar, Reuel, Soni et al. (2026). "A Systematic Study of Benchmark Saturation." arXiv:2602.16763(饱和 42.9%→54.5%;公开与私有无显著差异)。
  • Schaeffer et al. (2026). "Quantifying the Effect of Test Set Contamination on Generative Evaluations." arXiv:2601.04301(污染悖论)。
  • 主源 research/deep/D4 子主线 1/2/3/5 与 research/deep/D7 §5(held-out 作为四条退路之一)。
接下来去哪