Y03 说过考题会被吃进训练集:题目泄漏进训练数据,分数就在度量记忆而不是能力。下一个问题是取证:给你一个模型和一个分数,你能不能查清楚它有没有背过题,背题抬高了多少分。答案会让你不太舒服。主流检测方法基本失效,是第一层原因;泄漏的效应还会随训练过程漂移,是第二层原因。两层原因叠加,以至于「证明一个分数是干净的」在原则上可能就做不到。这决定了你该用什么姿势去相信任何一个分数。
先摆开取证工具箱,一共三层。第一层查逐字重叠:把测试题切成小片段(术语叫 n-gram,就是连续几个词的组合),去训练语料里搜有没有一模一样的;现有基础设施已能在万亿词级别的语料里做这种检索。第二层在拿不到训练语料时用,叫成员推断(membership inference):从模型对一道题的「熟悉程度」(比如答得过分流畅)反推它训练时见没见过这道题。第三层是行为学对照:按原题的风格重新出一套全新的题,让模型重考,掉分多少就是记忆成分的行为学证据。三层里,前两层已被证明基本失效,只有第三层立得住。但第三层贵又慢,只能一个基准一个基准地做。
第一层的失效是对抗性的。Yang 等 2023 年做了个简单实验:把测试题改写一下(换个说法,或翻译成另一种语言)再混进训练集。结果,基于逐字重叠和向量相似度的标准筛查全部放行,而分数照样被大幅抬高。他们的结论是:只有用大模型做语义级比对,才能抓住改写型泄漏。Dekoninck 等 2024 年把话说得更冷:规避现有全部污染检测的成本低到论文标题都带着讽刺,「太容易了」。防守方用什么检测器,进攻方就能廉价绕过什么检测器。
第二层的失效是统计性的。Duan 等 2024 年系统测试成员推断在大语言模型上的表现,结论是几乎不比抛硬币强:训练数据太大,一道题只被看过极少几次。这极少的几次留下的痕迹,在模型权重里被稀释到探测不出来。Meeus 等 2025 年的系统综述给这条路线起的标题是 rushing nowhere(原地狂奔),还点破了一个更难堪的事实:不少宣称「检测出污染」的研究,测到的其实是别的东西。它们拿来对照的「没见过的题」往往比「见过的题」更新,模型对新时段的内容本来就更陌生。这种时间差,被误当成了记忆的信号。换句话说,一大批「某模型污染了某基准」的公开指控,在方法上站不住。
就算确认了泄漏,「抬了多少分」也不是一个有固定答案的问题。Schaeffer 等 2026 年用因果框架直接量化泄漏的效应,结论是路径依赖的,可以概括成一个悖论。一方面,泄漏很致命:哪怕只有一份测试集副本混进预训练语料(模型学习互联网规模文本的第一阶段),就足以把模型在这套题上的表现推到凭真本事不可能达到的程度。另一方面,泄漏又很脆弱:泄漏之后继续用大量新鲜数据训练,效应会被冲淡甚至抹平;后续的微调阶段则可能放大、也可能继续稀释,取决于之前泄漏有多深。同一次泄漏,落在训练时间线的不同位置,结局完全不同。
这个悖论恰好解释了 Y03 里 GSM1k 的著名观察:为什么重制新题之后,前沿大厂的模型几乎不掉分,某些小模型家族却掉 8% 到 13%。前沿模型在可能的泄漏之后还压了极大量的后续训练,早期污染被洗淡了;小模型的污染离最终版本更近,痕迹还热着。所以「掉分等于注水量」的线性直觉是错的:污染的伤害不由「泄没泄」单独决定,还由整条训练历史决定。
这也解释了为什么重制对照是目前唯一立得住的取证方法,以及它到底测到了什么。GSM1k 按小学数学基准 GSM8K 的风格、难度、解题步数重新出了 1000 道全新题,各模型的掉分幅度与「能逐词背出原题的概率」正相关,剂量与反应对得上,这是行为学取证的标杆。苹果团队的 GSM-Symbolic 把刀磨得更细:只把题目里的数字换掉,多数模型的分数就明显下滑;往题干里塞一句看起来相关、其实无关的废话,最先进模型的掉分幅度最高可达 65%。多一句无关信息,本不该影响答案——真正的推理理应对它视而不见。可模型的分数照样崩,这说明它依赖的不是推理,是题型模板。这把取证对象从「背过这道题」扩展到「背过这类题」:模型可以没见过这道题的任何一个字,却见过一万道同构题,而逐字检测对此完全免疫。2026 年提出的 soft contamination(软污染)概念把这条推到头:即使零逐字泄漏,只要训练数据与考题的分布过于接近,基准测到的也只是浅层泛化。到这里,污染问题与 Y01 的过拟合定义合流:真正要查的不是「见没见过这个字符串」,而是「分数里有多少,换一套题就蒸发」。
把三层失效叠起来,「证明分数干净」的处境接近逻辑死局:逐字检测可被改写绕过,成员推断没有统计功效,语义检测又可被进一步规避,行为学对照只能逐个基准手工做。合理的结论不是继续找更强的检测器,而是承认举证结构本身错了:干净证明不了,只能靠制度设计让污染变难、变贵、变得不划算。出路有三条。其一,held-out 私有集:把一部分题库锁起来,永远不进任何人的优化循环。其二,时间切分:只用晚于模型训练截止日期的新题评测,比如编程基准 LiveCodeBench 按题目发布日期过滤,LiveBench 每月替换约六分之一的题目,让时间轴当白名单,新题在物理上不可能被背过。其三,把污染审计写进基准的发布规范。但也要按证据记账:2026 年一项覆盖 60 个基准的系统研究发现,公开测试集与私有测试集在「被刷到失去区分度」的比例上没有统计学差异。私有集题目是藏起来的,本该更抗打——可它照样和公开集一样失去区分度。这说明藏题挡得住逐字泄漏,却挡不住整个生态朝着基准的方向适应。制度防线的完整版本在 G03 展开。
留一个问题:前沿模型的分数虚高里,污染、评测脚手架(提示模板、答案抽取这些外围设置)、真实能力各占多少?Schaeffer 给了「取决于训练生命周期」的机制答案,但跨基准、跨厂商的份额分解至今没有公认结果。在它出现之前,「这个分数有多少是真的」对任何单一模型都只能答到区间为止。research/deep/D4 子主线二把它列为头号开放问题。
一句话带走:你查不出一个分数干不干净;能做的是把评测设计成没法脏,或者假定它已经脏了再去读它。
来源 / 延伸阅读
- Yang et al. (2023). "Rethinking Benchmark and Contamination for Language Models with Rephrased Samples." arXiv:2311.04850(LLM Decontaminator);Dekoninck et al. (2024). "Evading Data Contamination Detection for Language Models Is (Too) Easy." arXiv:2402.02823。
- Duan et al. (2024). "Do Membership Inference Attacks Work on Large Language Models?" arXiv:2402.07841;Meeus et al. (2025). "SoK: Membership Inference Attacks on LLMs Are Rushing Nowhere (and How to Fix It)." IEEE SaTML;Liu et al. (2024). "Infini-gram." arXiv:2401.17377。
- Schaeffer et al. (2026). "Quantifying the Effect of Test Set Contamination on Generative Evaluations." arXiv:2601.04301(污染悖论;2026 编号,引用前请复核)。
- Zhang et al. (2024). GSM1k, arXiv:2405.00332;Mirzadeh et al. (2025). "GSM-Symbolic." arXiv:2410.05229(ICLR);Spiesberger et al. (2026). "Soft Contamination." arXiv:2602.12413(待核)。
- Jain et al. (2025). "LiveCodeBench." arXiv:2403.07974;White et al. (2024). "LiveBench." arXiv:2406.19314;Akhtar, Reuel et al. (2026). "A Systematic Study of Benchmark Saturation." arXiv:2602.16763(待核)。
- 深化见
research/deep/D4子主线二、三;research/13(Y03 简报)、research/05§二。