全球最有影响力的 AI 模型排行榜,分数里有多少水分?把红支法学院排名的故事换成模型排行榜,反应性的结构一字不改,只是周期从几年缩短到几周。这里也是 R10(人气会自我放大)与 Y03(考题会被吃进训练集)两条线的交汇。
先介绍这个榜。Chatbot Arena(后改名 LMArena)的机制本身很优雅:用户提一个问题,两个匿名模型各答一次,用户投票选更好的那个;再用统计模型(Bradley-Terry,本质是从大量两两比较里给每个选手算总实力,象棋等级分是同类思路)把几百万场对战聚合成每个模型的分数与排名。匿名消除了品牌偏见,真人投票贴近真实使用,它因此一度被当作「真实能力」的金标准榜。金标准换来关注与采用,这份好处也恰恰让它成为被优化的头号目标。
2025 年 4 月,Cohere 团队联合多家机构发表《The Leaderboard Illusion》(排行榜幻觉),对这个榜做了最系统的解剖:分析 2024 年 1 月到 2025 年 4 月约 200 万场对战、42 家厂商的 243 个模型。要拆的问题一句话:榜上的分数里,多少是能力,多少是对这个榜本身的适应。论文最扎眼的估计:哪怕只拿到少量 Arena 对战数据去调优,也能在 Arena 分布上带来最高 112% 的相对提升。翻译一下:不用把模型变好,只要学会这个榜的口味,分数就能大幅上涨。
拖动滑块,看真实排第 11 的模型如何被抬进前几名。指控主要有三条,模拟里都能亲手复现:
- best-of-N 私测:少数厂商可以在发布前私下测试很多个变体,只公开分数最高的那个,不满意的成绩悄悄撤回。分数都带运气成分,从一堆带噪声的分数里专挑最高的,挑中的多半是运气偏好的那个(
B13优化者诅咒讲的就是这个机制),期望名次被系统性抬高。据论文指控,Meta 在 Llama 4 发布前私测了多达 27 个变体。 - 数据访问不对称:论文估计 Google 与 OpenAI 各拿到全部对战数据的约 19.2% 与 20.4%,83 个开源权重模型合计只有 29.7%。场次多,排名就稳;表现差的变体还能被静默下架、不留痕迹,制造幸存者偏差。
- 风格分:模型不必更有能力,只要更会讨好投票者:更长的回答、更多列表、热情开场、emoji。分数上升,模型未必更好。
风格这条有一个赤裸的实例。2025 年 4 月 5 日 Meta 发布 Llama 4,博客宣传 Maverick 在 LMArena 拿到高分(ELO 1417)。几天内被发现:上榜的是一个专为对话讨喜特调的「实验版」,回答冗长、爱堆 emoji,与实际放出给大家用的正式版不是同一个东西。科技媒体跟进报道,社区称之为诱饵调包。LMArena 道歉、修改政策,把没特调过的正式版重新上榜,结果排在 GPT-4o、Claude 3.5 Sonnet 与 Gemini 1.5 Pro 之下。「把模型塑造成榜的形状」在这里不是隐喻,是产品决策。
榜方的自救也值得记录。早在 2024 年 8 月,LMArena 就承认「回答长度」是影响投票的最强单一风格因素,于是上线 style control(风格控制):把长度、标题数、列表数这些风格变量放进统计模型一并估计,再把它们的影响从质量分里扣掉。应用之后,以冗长著称的模型排名下滑。度量机构把「被优化出来的形状」显式建模再扣除,这是反应性与反-反应性的军备竞赛,攻防都在演化。
2025 到 2026 年,两条新证据把问题推得更远。其一,刷票被证明可以定量攻击:Min 等人在 170 万条真实投票上模拟,发现只往目标模型自己的对战里灌票,效率很低,升一名要一万票以上。但这套统计模型有个特性:任何一票都会牵动所有模型的相对位置,哪怕那场对战与目标模型无关。利用这种全局耦合、配合识别匿名模型的分类器,约两万票能把目标模型抬升十名;受限访问的现实设定下几百票就能升五名。其二,裁判开始有自己的生意:LMArena 从伯克利的学术项目公司化,2025 年 5 月完成 1 亿美元种子轮(估值约 6 亿美元),2026 年 1 月 Series A 再融 1.5 亿,估值跳到 17 亿美元。当今最有影响力的模型排行榜,由一家以这个排名为核心产品的公司运营。测量的反应性之上,从此叠加了资本利益,治理问题移交 Y15 展开。
两条前置线在这里交汇。R10 的音乐实验证明:在能看见别人选择的市场里,早期的一点人气优势会滚成巨大的最终差距。排行榜正是这样一个人工市场:「发布即登顶」的头条带来试用与好感,好感变成投票,马太循环闭合。Y03 则从题目那头进来:拿到对战数据的厂商可以让模型专门适应这个榜的问题分布,这正是 112% 那个数字量出来的东西。人气自我放大、口味被提前学会,两台机器叠在同一个榜上,「发布即登顶」于是既可能是实力,也可能只是机器在转。
留一个问题:Min 等人证明了刷票在技术上可行,但公开数据里实际发生过多少协同刷票,没有人能测,这是反应性的暗数字。一个测量系统的可玩性被定量证明之后,它的读数该打多少折扣,折扣本身能不能被估计?research/deep/D4 §4 把「商业化后的活榜还能不能自我纠偏」一并列为开放问题。
一句话带走:排行榜越重要,「把模型做好」和「把榜刷好」就越是两门不同的生意,而分数本身分不清你看到的是哪一种。
来源 / 延伸阅读
- Chiang et al. (2024). "Chatbot Arena." arXiv:2403.04132(机制论文)。
- Singh et al. (2025, Cohere). "The Leaderboard Illusion." arXiv:2504.20879(NeurIPS 2025 D&B)。
- Min et al. (2025). "Improving Your Model Ranking on Chatbot Arena by Vote Rigging." arXiv:2501.17858(刷票攻击曲线)。
- LMArena 融资:Reuters 2026-01-06(估值 17 亿美元);平衡视角:Willison (2025-04-30) 与 LMArena 官方回应;style control:lmsys.org (2024-08-28)。
- Elo/Bradley-Terry 假设的测量学批评(可传递性、单一维度):见
research/deep/D4§4。 - 深化见
research/13(Y11 简报)、research/05§三、research/deep/D4§4;模拟experiments/exp2。