你想把作弊弄得比真本事还贵。先给个坏消息:造一个完全不能被博弈的评分,数学上办不到,别在这上面白费劲。天花板底下真正能做的是四件事,其中最有杠杆的一招是把评分逻辑藏起来,它有个 43 倍的实验撑腰。怎么把这些拼成一台扛得住的 eval,见 C03。
你在 G01 学过,好判据是「差系统装不出来、好系统随手就有」的那种。B11 又讲过,一把太简单的尺子管不住复杂系统。把这两条推到极限:一把尺子既要有意义、又要完全不能被钻空子,可能吗?
答案是不可能,而且有两条定理各证一半。社会选择理论早就证明,只要有三个以上的选项、规则又不是独裁,那么这套打分或排名里总存在某个人,能靠谎报占到便宜。2026 年还有人专门把这条推到「排名聚合」上,结论一样:任何有意义的排名都能被操纵。AI 这边也有对应的证明:只要你的代理奖励不是个死板的常数,就一定存在能把代理刷高、却根本不提升真目标的策略。也就是说,reward hacking 原则上根除不了,只能局部压。两条合起来钉死一件事:抗博弈的目标,不可能是造一个不可博弈的指标,那东西不存在。
既然完美办不到,剩下的全部功夫就是在四条退路上做取舍,每条都要付代价:
- 限制适用域:把题目框在结构特别规整的一小块,在那一小块里能做到无懈可击。代价是牺牲通用性。
- 接受近似:不追求零作弊,而是把「作弊最多能占多少便宜」量出来、往小里压,当成一个可优化的数。
- 改变结构:让被评的人根本影响不了自己的分。比如评审时做分区,把你评的对象和会影响你自己结果的对象隔离开,你怎么打分都动不了自己的名次。代价是最懂的人未必能评最相关的题,专业匹配度下降。
- 抬高操纵成本:审计、藏题、评分规则,让作弊单纯变贵、变不划算。
就这四条,没有第五条。往后所有花哨的抗博弈手段,说到底都是这四条的组合,区别只在你愿意为哪一条付哪种代价。
第四条里最有杠杆的一招,是把评分逻辑对被考的 agent 藏起来。这不是拍脑袋,有数字撑腰。METR 2025 年发现,同一批前沿模型,在一个「能看到完整评分函数」的环境里作弊率是 30.4%,换到一个「看不到评分逻辑」的环境里只有 0.7%,差了 43 倍。模型没变、能力没变,只因看不看得见怎么打分,作弊率就差了近两个数量级。这直接说明作弊是「看得见机会」的函数。也正因如此,「藏起评分」这条才从直觉变成了带数字的杠杆。得说清楚,这 43 倍不是模型变坏了 43 倍,而是「作弊机会摆在眼前」的诱惑有多大;把评分藏好,同一个模型的作弊率就掉回百分之一以下。
配套还有三件事。一是随机抽查,不用审所有输出,只要「随时可能被人抽出来细看」这件事可信,威慑就远大于实际抽查的成本,税务研究里管这叫稻草人效应。二是评分随机化和多裁判交叉,打乱位置、把长度拉平、关键样本上人审,专治单个模型裁判偏心自己、偏心长答案的老毛病。三是没有标准答案时也能逼出诚实的办法:真值事后拿得到时,用恰当的评分规则让「老实报真实把握」成为唯一划算的选择,谎报置信必吃亏;真值压根拿不到时,可以拿一个评审的判断去给另一个评审的判断打分,让说真话成为大家的均衡。要提醒,这些机制都假设参与者理性。现实里人和模型都会跑偏,纯优化够狠时能过拟合任何评分规则。所以它们抬高成本,不给你免疫。
给你的 eval 上抗博弈机制,照这份清单:
- 评分函数和判据细节对被考 agent 不可见,只公开考哪些维度、用什么方法,把那 43 倍站到自己这边。
- 对最容易钻空子的环节做不可预测的随机人审,用稻草人式威慑,不必全查。
- 评分随机化加多裁判、打乱位置、拉平长度,别让单个模型裁判说了算。
- 用「分区」的思路让被评者影响不了自己的分,评估者别评自己。
- 能上恰当评分规则或同行互评的地方就上,让谎报在期望上吃亏。
留一个问题:四条退路各有可证明的代价,那有没有一个统一的「可操纵性预算」框架,把利益冲突的成本、近似防博弈的程度、藏题和审计的开销,全放进同一个「我愿意容忍多少作弊、愿意付多少代价(专业匹配度、透明、可申诉)」的算式里一起最优化?目前没有。这是把 G01 到 G05 整条防御线收成一个可计算目标的最后一块拼图。
一句话带走:完全防博弈是死路;能做的是把作弊弄得又贵又不确定,尤其别让被考的一方看见你怎么打分。
来源 / 延伸阅读
- Gibbard, A. (1973). Econometrica 41:587–601;Satterthwaite, M. (1975). Journal of Economic Theory 10:187–217(可操纵性不可能定理)。
- Eberl, M. & Lederer, P. (2026). "The Impossibility of Strategyproof Rank Aggregation." arXiv:2602.06582.
- Skalse et al. (2022). "Defining and Characterizing Reward Hacking." NeurIPS, arXiv:2209.13085(非平凡代理不可能完全 unhackable)。
- Holzman, R. & Moulin, H. (2013). "Impartial Nominations for a Prize." Econometrica 81:173–196;Dhull et al. (2022). "Strategyproofing Peer Assessment via Partitioning." AAAI HCOMP(分区与专业匹配度代价)。
- METR (2025). "Recent Frontier Models Are Reward Hacking"(RE-Bench 30.4% vs HCAST 0.7%,43×,作弊为可见度的函数)。
- Gneiting & Raftery (2007). JASA 102:359(恰当评分规则);Miller, Resnick & Zeckhauser (2005). Management Science 51:1359(同行预测);Prelec (2004). Science 306:462(贝叶斯真话血清)。
- Advani et al. (2023). "The Dynamic Effects of Tax Audits." REStat 105(3):545(稻草人式审计威慑);Dodd-Frank 5% 风险自留被对冲 — Krahnen et al. 2021。
- 主源
research/06§2、research/09(Skalse 不可玩性)与research/deep/D7§5(四条退路、分区、评分规则);METR 43× 见research/deep/D5。