怎么判断一个 agent 是真有本事,还是只会对着测试装样子?一个出人意料的判据来自研究孔雀尾巴的生物学家:让信号可信的不是「贵」,而是「对说谎的人才贵」。分清这一点,你就知道该找哪种判据,那种差系统再努力也装不出来、好系统却随手就有的判据。
你在 B01 见过 Goodhart 定律:一个指标一旦变成大家要冲的目标,就不再是好指标。B12 的委托代理也讲过,你想要好 agent,优化器却只想让 eval 亮绿灯。既然指标总会被冲,有没有哪种信号天生就更难造假?
生物学早就在琢磨这事。孔雀拖着一条又大又碍事的尾巴,按理说该先被天敌吃掉。Zahavi 1975 年却说,正是这条累赘尾巴让它可信。这话怎么讲?只有真健康的孔雀,才养得起这么大的负担、还活得好;病弱的孔雀,养不起。这个养得起与养不起的落差,于是让尾巴成了健康的可靠证据。这个想法叫障碍原理,名声起落过三回。
三幕故事落到一句话:诚实不来自「贵」,来自「对说谎者才贵」。同一条尾巴,健康孔雀养得起,病孔雀养不起,这个成本落差才是关键,绝对的贵反而不必要。教科书常停在第一幕的「越贵越可信」,学界其实已经走到这一步。
顺着这句话,还有更省事的做法。经济学里有个词叫 cheap talk,直译是零成本的空口白话,它证明了一件很有用的事:如果说话的人和听话的人利益一致,说真话根本不用花钱,空口白话就够可信;反过来,双方利益冲突越大,才越需要昂贵的信号去把谎话压住。一句话,维持诚实要花多少成本,跟利益冲突的大小成正比。
举个身边的例子。你问同组同事「这段代码有没有 bug」,他和你在一个组、bug 出了也砸他的活,他没理由骗你,随口一答就可信;可要是他是外包、多报「没问题」就能早点结款走人,你就不得不加验收、加追责,也就是加成本。同一个问题,成本该加多少,全看你俩利益差多远。
这给了你一个跟直觉相反的设计顺序:别一上来就把门槛往死里抬。先想办法让考题的设计者和被考的 agent 利益一致,把冲突降下来;再决定还要不要加成本。就算要加,也不用加到天上,给谎报加一点点确定的代价(一定概率被抽查、事后追责),就能把诚实往回拉不少。
最狠的一种判据干脆不靠成本,靠物理。有些信号,低质量的一方压根造不出来。小鸟发不出大鸟那种低沉的叫声,因为音高被身体大小卡死了,这信号不花力气,却假不了,这类叫 index 信号。落到 eval 上它最值钱:真能跑通的程序、能复现的实验结果、多步操作后留下的真实后果,都是由任务结构决定、弱模型物理上做不到的东西,比任何「难度很高」的评分都靠得住。这条到 G05 会推成正式的机制设计,操作台在 C03。
这不是纸上谈兵。有一批编程测试就栽在这上面:模型分数很高,后来发现它多半是把人类早就写好的修复补丁逐字背了出来,是记忆不是推理。如果当初判据盯的是 index 型的东西,比如改动前后程序行为的真实差异、能不能跑通一组它没见过的测试,光靠背答案就拿不到分。差系统装不出「真跑通」,这就是 index 信号的价值。
看一个判据抗不抗造假,照着三步问就行:
- 先问利益:出题的人和被考的 agent,利益一致吗?能不能让出题的人自己也要用这个 agent 干活?冲突越小,后面越省事。
- 再找结构:这道题里有没有「弱模型物理上做不到」的部分?能跑通的程序、能复现的结果、留下真实痕迹的操作,优先用它们当判据。
- 最后算成本差:对想蒙混的差系统,造出好看结果要多费多少劲?如果差系统和好系统一样轻松、或一样吃力,这判据就没用;你要的是差系统特别费劲、好系统随手就有。
还得提前打个预防针:任何一种判据,一旦大家都摸清了、都照着优化,就会慢慢失灵。这跟文凭贬值一个道理,大学文凭稀罕时能证明能力,人人都有之后就不值钱了。被考的一方会朝判据聚拢,分辨力越来越弱。一套公开的编程基准往往就是这样,头一年还能拉开模型差距,两三年后大家都在上面刷,分数全挤到顶,也就废了。所以抗博弈不是「设计一次好判据」就完事,最好给每个判据记个「服役时长」,算着它多久会被摸透、定期换新,这条接 G03 的动态刷新和 G04 的指标轮换。
留一个问题:如果诚实靠的是「差异」而不是「昂贵」,那在人造的评分系统里,我们到底该复制成本上的差异,还是收益上的差异?生物学里那种「小鸟天生发不出低音」的结构性不可伪造,人造 eval 里有没有对得上的东西?这是 D7 报告留的关键缺口。
一句话带走:好判据不是最难的那个,是「差系统装不出来、好系统随手就有」的那个。
来源 / 延伸阅读
- Zahavi, A. (1975). "Mate selection—A selection for a handicap." Journal of Theoretical Biology 53(1):205–214.
- Grafen, A. (1990). "Biological signals as handicaps." Journal of Theoretical Biology 144(4):517–546.
- Penn, D. J. & Számadó, S. (2020). "The Handicap Principle: how an erroneous hypothesis became a scientific principle." Biological Reviews 95(1):267–290.
- Számadó, Zachar, Czégel & Penn (2023). BMC Biology 21:4;Számadó, Zachar & Penn (2026). J. Evolutionary Biology 39(2):171(trade-offs 框架)。
- Crawford, V. P. & Sobel, J. (1982). "Strategic Information Transmission." Econometrica 50(6):1431–1451.
- Lachmann, Számadó & Bergstrom (2001). "Cost and conflict in animal signals and human language." PNAS 98(23):13189–13194(waste is not required)。
- Kartik, Ottaviani & Squintani (2007). "Credulity, lies, and costly talk." JET 134(1):93–116;Spence, A. M. (1973). "Job Market Signaling." QJE 87(3):355–374。
- Biernaskie, Perry & Grafen (2018). "A general model of biological signals, from cues to handicaps." Evolution Letters 2(3):201–209(连续谱的温和派)。
- 主源
research/10§1–4 与research/deep/D7§1–2;争论两方与 index 信号见 D7-1。