七个杠杆是一张记分卡。拿到任何一个排名或评测,逐项打分,你就能估出它大概会被扭曲到什么程度。你在 R01 学过反应性、在 B01 学过 Goodhart 定律、在 Y04 学过 reward hacking,三者讲的其实是同一件事,但都停在「会失真」这个定性判断上。这张记分卡的用处,是把定性判断变成一个能横向比较的量:哪个系统更危险,同一个系统随时间在往哪个方向漂。
它不是一个经过经验校准的绝对指数,别把最后那个数字当成测准了什么。它是一把结构化的梳子,逼你把「这榜会不会被玩坏」这个模糊担忧,拆成七个能分别回答的具体问题。
七根杠杆逐一是这样问的:
- 垄断度:这个对象被几套独立的排名覆盖?只有一套权威榜,规训力最强;四五套并存、互相拆台,就弱。
- 利害绑定:这个数字连着钱、生死、还是发布决策?绑得越硬,反应越烈。
- 粗暴度:输出是一个全序名次,还是一张多维仪表盘?压成单一名次,区分度的假象最强。
- 发布节律:多久发一次?连续实时的天梯,制造永不停歇的备战。
- 零和性:是相对排名还是绝对达标?你升我必降的零和,会催出军备竞赛。
- 可绕行通道:指标和真目标之间的因果链有多长、有多少旁路?能自报、能重分类,就好绕。
- 被测者反身能力:被测的一方会不会逆向工程你的公式,它本身是不是个优化器?
拨几个预设,规律就出来了。美国 U.S. News 法学院排名几乎每根杠杆都拉满:唯一权威、硬绑录取与预算、压成全序名次、年年发布、零和、可靠自报数据绕行、院长们专职逆向工程公式。七项满分二十一分,它拿满,所以是反应性的极端标本。这个满分标本,正是 Espeland 与 Sauder 田野里那个「几乎缓冲不掉」的样本。商学院排名换个数字。因为有五家排名并存,垄断度这一格从 3 掉到 1。垄断度一降,整体分数跟着低一截。这个更低的分数,正好对上 Sauder 与 Espeland 那篇《Strength in Numbers》的发现——商学院的排名效应确实明显更弱。多元测量互相消解,是这条规律最实用的一半。
再补一个 AI 侧的读数。Chatbot Arena 这类实时天梯,垄断度中等、利害高、粗暴度高、节律实时、零和、被测者本身就是优化器——七项加起来落在高位。分数一高,它的 Goodhart 化就以月为单位发作,比大学排名快一个数量级。快不是因为 AI 更爱作弊,是因为被测者本身就是优化器,这是结构差异不是道德差异。刷票研究给了它一个定量注脚:在真实历史投票上模拟,约 2 万票能把一个模型的名次推高十名左右;而只拿到少量 Arena 数据去过拟合它特有的分布,就能带来高达 112% 的相对性能提升,可这未必是通用质量的提升。
再看一个良性的对照。洛杉矶餐厅的卫生评级卡只分 A、B、C 三档,不搞全序,后果也软,被测者几乎无力逆向工程,七项加起来只有个位数。结果 Jin 与 Leslie 2003 年测到的是真实的卫生改善、食源性疾病住院下降,没有军备竞赛。同一个反应性机制,杠杆低的时候能推着质量往上走。这说明记分卡量的不是「有没有反应性」,而是「反应性会往好还是往坏使劲」。
这张记分卡还带出三条不那么显然的结论。
其一,反应性可以同时提高测量效度、摧毁测量价值。自我实现那条通道会让排名「变准」,因为世界已经被它重塑得跟它一致。可它测的,已经是自己造出来的那个世界;「准」和「好」,因此成了两码事。
其二,改良指标不等于消除反应性。指标每次修订本身也是被博弈的对象:U.S. News 年年微调公式,Arena 上了 style control,厂商就转头去优化 style control 之后的残差。指标和被测者是共同演化的一对,你动一下,它跟一下。
其三,最危险的不是坏指标,是「够好」的指标。相关性高的代理会赢得信任,赢得信任就被绑上利害,绑上利害就迎来强优化,然后在强优化下失效。Gao 那条过优化曲线先升后降,讲的就是这个「够好」指标的宿命。
2025 到 2026 年的证据,给这张七格记分卡逼出了第八根候选杠杆。你在 Y15 见过它的名字:裁判的利益相关度。它问的是一件前七根都问不到的事,打分机构的收入、估值或数据来源,是不是依赖被打分的那一方。
三个当代事件都落在这根杠杆上。其一,最有影响力的活榜 LMArena 从伯克利的学术项目公司化,2025 年 5 月拿到 1 亿美元种子轮(估值约 6 亿美元),2026 年 1 月 Series A 再融 1.5 亿,估值跳到 17 亿美元,同时把排名做成了付费产品。当裁判本身是一家靠榜单公信力变现的公司,它纠偏的意愿还能不能持续、会不会向大客户倾斜,没有外部审计能证。style control 证明运营方有能力把被优化出来的风格显式扣掉,可有能力不等于有意愿。其二,抗污染基准 FrontierMath 由 OpenAI 出资,OpenAI 还拿到了对绝大多数最难题目的独家访问权,随后用这套题宣布 o3 拿到 25%(上一代只有 2%)。「模型没见过题」这个卖点,于是从可验证的事实,退化成一句只能选择信或不信的口头约定。其三,厂商发布会上的基准精选:同一个模型的分数随外围设置能漂好几个百分点,把哪些基准放上模型卡,本身就是一场表演。
这根杠杆和前七根正交。一个垄断、高利害、实时更新的榜,裁判可以中立,也可以不中立,前七根量不出这个差别。操作化的问法可以很朴素:裁判换一个对金主不利的结论,自己要损失多少。损失越大,读数越该打折。
留一个问题:七根还是八根杠杆等权相加,本身就是一个未经校准的选择。有没有可能用大量真实案例,把每根杠杆的权重、以及它们之间的交互,真正估出来,让这张记分卡从「教学直觉」升级成「可验证的反应性强度指数」?这是这个领域至今没人系统占领的一块空地。
一句话带走:预测一个榜会被玩坏多狠,别猜,逐项打分;也别忘了问一句,打分的人自己有没有下注。
来源 / 延伸阅读
- 框架综合自
00-SYNTHESIS-总纲.md §4。综合指标的任意性:Saisana, Saltelli & Tarantola (2005). JRSS-A 168(2):307–323。 - 垄断度与多元消解:Sauder & Espeland (2006). "Strength in Numbers";良性反应性:Jin & Leslie (2003). QJE 118(2)(餐厅卫生评级卡)。
- 第八根杠杆(裁判利益相关度)与新证据:LMArena 融资 Reuters 2026-01-06;FrontierMath 资助争议 TechCrunch 2025-01;见
Y15与research/deep/D4子主线四、research/deep/D5。