图鉴
全部 69 个节点、核心术语表,以及一张「讹传更正」速查。这门课花了大力气考证每一处流行说法的真正出处。
反应性
排名不只反映现实,它参与重新制造现实。
R02自我实现预言
一个假定义,如何长成真事实。
R03可通约化
三页纸总结全美法学教育。
R04规训与监视
为什么组织缓冲不掉排名。
R05可读性
国家为了看清你,先把你改简单。
R06循环效应
分类会改变被分类的人。
R07表演性
理论不是照相机,是发动机。
R08反身性
价格反映基本面,也塑造基本面。
R09审计社会
让组织可审计,本身成了目的。
R10马太效应与人工市场
最好的歌,命运却看运气。
R11霍桑效应及其证伪
连反应性的招牌案例都没通过原始数据检验。
R12机械客观性
「客观」不是发现出来的,是制度需要出来的。
R13排名的反击
集体退出排名两年后,排名毫发无损。
R14排名的情绪机器
焦虑、诱惑、抵抗:排名是怎么住进人心里的。
R15统计思维的诞生
「正常人」是十九世纪的一项发明。
Goodhart 定律
一条小小脚注如何统治了世界。
B02Campbell 定律
警示指标的人,本是测量的旗手。
B03Lucas 批判
你一用规律,人就改行为。
B04眼镜蛇效应
悬赏捕蛇,市民开始养蛇。
B05McNamara 谬误
不能测量的,最后被宣布不存在。
B06奖励A却指望B
希望教学好,却只奖励发表。
B07代理指标替代
为什么当事人不觉得自己在作弊。
B08Goodhart 四型
同一句格言,四种完全不同的机制。
B09多任务代理
教师为什么拿固定工资:一条定理。
B10绩效测量扭曲
便宜、低噪、可控,仍可能是坏指标。
B11必要多样性
只有多样性能消灭多样性。
B12委托代理
你要好 agent,优化器只要 eval 通过。
B13优化者诅咒
选中的那个,真值期望低于它的估计。
B14良性指标的条件
什么时候应试就是学习?定律的边界条件。
B15被遗忘的前传:Ridgway 1956
1956 年就有人把这一切写全了,然后被遗忘了六十年。
B16信号、废话与证明
说话不要钱,所以承诺不值钱。
B17向均值回归
榜首回落不需要任何阴谋,数学自己就会这么干。
过拟合
训练集就是你的 eval。
Y02自适应过拟合
你反复看同一个测试集,就已经在训练它。
Y03基准污染与饱和
题被吃进训练集,题本身也可能是坏的。
Y04奖励破解
划船 AI 不跑圈,原地打转刷分。
Y05最近未堵策略
修 eval 的方式为什么总是机械的。
Y06内对齐与 mesa 优化
你训练出的,可能是另一个优化器。
Y07奖励模型过优化
Goodhart 定律最干净的一条实验曲线。
Y08谄媚
奖励人类满意,得到讨好。
Y09表演性预测
预测改变分布:反应性的数学化。
Y10策略性分类
公布评分规则,人就照着改自己。
Y11排行榜幻觉
发布即登顶,分里有多少是押题?
Y12评估觉察
被观察的模型,不是真实的模型。
Y13污染取证学
你甚至无法证明一个分数是干净的。
Y14智能体评测前线
被测的不再是答案,而是一连串行为。
Y15评测科学运动
给评测本身做评测。
Y16RLHF:把偏好当燃料
训练 AI 讨好人类之前,先得把「喜欢」变成数字。
Y17基准是怎么造出来的
每一张考卷背后都有人在赶工。
- Reactivity 反应性
- 人因被测量、观察、评估而改变行为,本课的地基(Espeland & Sauder)。
- Commensuration 可通约化
- 把异质的质压成共享一把标尺的量;主动创造可比性,而非发现相似。
- Self-fulfilling prophecy 自我实现预言
- 起初为假的定义,经由改变行为把自己变真(Merton)。
- Performativity 表演性
- 理论不是照相机而是引擎;使用使世界向理论收敛(Barnesian)或背离(counter)。
- Looping effects 循环效应
- 分类改变被分类者,被分类者反过来改变类别;人的种类是移动的靶(Hacking)。
- Legibility 可读性
- 为治理而把社会简化成可测形式;操纵的前提(Scott)。
- Goodhart 定律
- 任何统计规律一旦用于调控就崩塌;流行的'measure/target'版实为 Strathern。
- Campbell 定律
- 指标越用于高利害决策,越腐蚀它本要监测的过程。
- Requisite variety 必要多样性
- 只有多样性能消灭多样性;单一指标约束不住复杂系统(Ashby)。
- Surrogation 代理指标替代
- 把衡量目标的指标当成目标本身的认知替换,Goodhart 的心理地基。
- Reward hacking 奖励破解
- 优化器把奖励拉满却不做你想要的事;Goodhart 在梯度下降里的重演。
- Nearest unblocked strategy 最近未堵策略
- 打一个补丁,优化器就找到最近的绕行捷径;这是修 eval 总显得机械的原因。
- Adaptive overfitting 适应性过拟合
- 反复用同一测试集做选择,就把它的特异性学进模型:看也是训练。
- Performative prediction 表演性预测
- 预测改变数据分布;重训练收敛到'自造世界'而非最优(Perdomo)。
- Optimizer's curse 优化者诅咒
- 从多候选择优即高估;选中者的真值期望必低于其估计。
- Trade-offs 权衡(诚实信号现代版)
- 诚实由质量依赖的净收益差维持;成本差只是其中一种实现,均衡成本可为零(Számadó et al. 2023/2026)。
- Strategic classification 策略性分类
- 公布分类器,被分类者照规则改造自己;想诱导真改进必须解因果推断问题(Miller-Milli-Hardt 2020)。
- Evaluation awareness 评测觉知
- 模型识别出自己在被测并改变行为;2025 年已有因果证据,读数本身被污染。
- Proxy failure 代理失效
- 跨神经科学/经济学/生态学的统一命名,把成瘾、孔雀尾与 Goodhart 收进同一机制(John et al. 2024, BBS)。
- Good regulator theorem 好调节器定理
- 好的调节器必是被调节系统的(同态)模型;scalar eval = 没有模型的调节(Conant & Ashby 1970)。
- Mechanical objectivity 机械客观性
- 遵循公开规则、排除个人判断的客观性:谁来算结果都一样;不信任裁量的社会转而信任程序与数字(Porter)。
- L'homme moyen 平均人
- Quetelet 把误差曲线搬到人身上:正中央从杂音翻转成理想与标准,「正常/不正常」这条线由此被画出。
- Cheap talk 空口白话
- 零成本的话能传多少真,由双方利益一致程度单调决定;维持诚实所需成本正比于利益冲突(Crawford & Sobel)。
- Regression to the mean 向均值回归
- 极端成绩里掺着运气,再测一次运气散去分数自然回落;先扣回归,再谈反应性(Galton)。
- RLHF 从人类反馈做强化学习
- 人类二选一→奖励模型→拿分当靶子拧策略;三步连续降维,模型最后追的是刻度不是你心里的「好」。
- Bradley-Terry 配对比较模型
- 假设每个选手有隐含实力值,从大量两两胜负里反推;竞技场排名与 RLHF 奖励模型的共同统计骨架。
- Benchmark saturation 基准饱和
- 顶尖模型间失去可统计区分的分辨力;随基准年龄温和上升,公开与私有题库无显著差别。
- Red-teaming 红队
- 雇捣蛋鬼抢在优化器前头找最近的未堵出口;只能证明「这里能破」,永远证不了「哪里都破不了」。
- Temporal split 时间切分
- 只考模型训练截止日之后出现的题,没见过未来就没法背;把防作弊从抬成本换成讲因果。
- POSIWID
- 系统的目的就是它实际所做的,不是它宣称的意图;短语确为 Beer 所述,缩写为后人定型。
- Impact factor 影响因子
- 某刊前两年论文的当年篇均被引;分子分母都留有套利面,DORA 主张不得以它评单篇与个人。
- Selection effect 选择效应(成绩单效应)
- 不改自身水平,改被测总体:医生回避高危病人,账面全真,比造假更难抓(Dranove 2003)。
- Success indicator problem 成功指标问题
- 单一总量指标下的方向性扭曲与品种坍缩:按吨造厚、按面积造薄,指标没写的等于死刑(Nove 1958)。
- 裁判的利益相关度(第八杠杆)
- 打分机构的收入、估值或数据来源是否依赖被打分者;与前七根杠杆正交,裁判可中立也可不中立。
这门课的一个隐藏主题:流行的说法往往不是原文。以下每一条都在正文里有完整考证。
| 流行说法 | 更正 | 见 |
|---|---|---|
| “When a measure becomes a target…” | 不是 Goodhart 说的。是 Strathern (1997, p.308) 措辞、Hoskin (1996) 命名。 | B01 / R09 |
| 德里眼镜蛇故事 | 无一手史料,疑为都市传说。有档案的是河内老鼠悬赏 (1902, Michael Vann)。 | B04 |
| McNamara 四步引文 | 实为 Yankelovich 1971 演讲;Handy 1994 误归给 McNamara。 | B05 |
| 霍桑效应(强版本) | 原始照明数据经 Levitt & List (2011) 重分析判为 'entirely fictional'。 | R11 |
| Ashby “absorb variety” | 原文是 'only variety can destroy variety';absorb 是 Beer 的改写。 | B11 |
| “不能度量就不能管理”≈Deming | 反了。Deming 视其为要破除的谬误;'最重要数字不可知'是他转引 Nelson。 | G02 |
| “Grafen 证明了障碍原则” | 该流行叙事被 Penn & Számadó (2020) 论证为对模型的误读。 | G01 |
| NUS 归于 Alex Turner | 更准的溯源是 Yudkowsky / Arbital(约 2015)。 | Y05 |
| Pygmalion 效应是铁证 | 效应主要限一二年级、复制不稳定,被 Thorndike 1968 批评。 | R02 |
| 苏联钉子厂 | 寓言级证据,无一手史料;巨钉漫画的《鳄鱼》刊期从未被可靠定位。机制真实但别当史实引用。 | K06 |
| 家族起点是 Campbell / Goodhart | 需前推:Ridgway 1956 (ASQ) 是最早的成文系统综述,早 19 年;三方原文互不引用,大概率独立发现。 | B01 / B15 |
| Goodhart 与 Lucas 独立发现 | 需收紧:Chrystal & Mizen (2003) 裁定「若两者等价,Lucas 几乎肯定先说」。 | B01 / B03 |
| Campbell 1976 与 1979 是两说 | 同一文本:油印本 (1976) = 期刊版 (1979),措辞一致。 | B02 |
| E&S 2007 提出「四机制」 | 2007 原文只有 2 机制 + 3 效果;narrative 出自 Espeland 2015,reverse engineering 与 emotional attachments 出自 Espeland 2016 (HSR)。 | R01 / R14 |
| MusicLab 证明成功纯随机 | 误读:2008 反转实验恰证质量设定边界,最好的歌能从人为打压中恢复。 | R10 |
| 霍桑效应作为统一效应成立 | 连概念本身都被判不成立;McCambridge (2014) 主张弃名,改用 research participation effects。 | R11 |
| 污染 = 分数线性虚高 | 路径依赖:同一次泄漏既可致命,也可被后续训练洗掉(Schaeffer 2026 的污染悖论)。 | Y03 |
| 反复刷同一榜必然严重过拟合 | 经验裁决温和得多:Kaggle 百场「little evidence of substantial overfitting」,机制是模型相似性。 | Y02 |
| winner's curse 出自 Thaler | 概念源自 Capen, Clapp & Campbell (1971) 三位石油工程师;Thaler 1988 是通俗化者。 | B13 |
| 好调节器定理证明需要世界模型 | 「model」只是同态映射;且因果方向常被讲反,原证明有技术空隙(Scholten 2010)。 | B11 |
| POSIWID 是后人讹传 | 这次不是讹传:短语确为 Beer 所述,仅缩写为后人定型。 | G02 |
| cost differential 是诚实信号的终点 | 已被 2023/2026 的 trade-offs 超越:成本可为零,关键是质量依赖的净收益差。 | G01 |
| 昂贵信号是诚实的必要条件 | 错:昂贵只在利益冲突时才需要,且需要量正比于冲突(cheap talk 传统)。 | G01 / B16 |
| 操演性 = 经济学总能自证 | 抹掉了 MacKenzie 四分类学,尤其方向相反的 counterperformativity。 | R07 |
| 「榜首回落」证明反应性 | 向均值回归足以单独解释;须先扣除回归再归因 Goodhart。 | B13 / B17 |
| 统计类别是建构的,所以是假的 | Hacking 明确反对:互动类既是建构的又是真实的,「建构=虚构」是对循环效应最常见的误用。 | R15 |
| Ridgway 拼作 Ridgeway | 误拼多了一个 e,连一些正式出版物都拼错;正确拼法是 Ridgway。 | B15 |
| 家族警句只有那句 measure/target | 最早最形象的警句是 Ridgway 1956 的青霉素比喻「治病的药有时比病更糟」,却几乎从未被通俗文章引用。 | B15 |
| Secrist:商业世界正走向平庸的胜利 | 1933 年整本书把向均值回归误当真实经济规律,成了统计学著名反面教材。 | B17 |
| 《体育画报》封面诅咒 | 上封面正因刚打出极端高峰,之后回落是纯回归;诅咒不存在,存在的是给回归编因果故事。 | B17 |
| RLHF 教模型对齐人类价值观 | 它优化的是「人类当场更喜欢哪个回答」;偏好模型常奖励迎合而非真话,谄媚被放大(GPT-4o 2025-04 回滚)。 | Y16 |
| 逼近满分=模型快把任务做完了 | MMLU 约 6.49% 错题把上限钉在 93.5% 附近:撞的是标注天花板与糙设计,不是能力天花板。 | Y17 |
| 把题藏起来,分数就是干净的 | 公开与私有测试集饱和率无统计显著差异;污染检测方法本身站不住,阴性不等于干净。 | G03 |
| 指标越多越抗博弈 | Meyer 2003 观察相反:指标越多扭曲往往越多;制衡只在各维正交、作弊手段不相通时成立。 | G04 |
| 设计得够好就能造出不可博弈的指标 | Gibbard–Satterthwaite 与 Skalse 等证明一般情形不可能;只能在四条退路上抬高操纵成本。 | G05 |
| 旧榜有病,换套更透明的新榜就好 | Doing Business 换成 B-READY 照被质疑「过时且不公」;US News 改法后博弈照旧。后果还在,改方法只是换战场。 | G06 |
| 过了红队测试就是安全的 | 红队只给下界:证明「这里能破」,证不了「哪里都破不了」;sandbagging 与评测觉知还在掏空地基。 | G07 |
| 上线跑 A/B 看真实数据就客观了 | 现实防的是自报造假,防不了选错代理;现实指标一旦成为目标照样滑回 Goodhart。 | G08 |
| Campbell 举过中国科举的例子 | 1979 原文全文无 China、无 imperial examination,科举例子是后人附会;「Campbell's Law」之名亦系后人所加。 | K01 |
| Bevan & Hood 证明了目标制失败 | 过度简化:受考核维度的改善是真实的,论点是改善与博弈并存、审计太弱无法区分比例。 | K02 |
| 豆瓣「锁分」/「评分皆水军」 | 法院认定锁分证据不足;水军攻击另有分布铁证。攻防双向,单方受害叙事是选择性引用。 | K04 |
| 成绩单证明公开透明是错的 | 把双向证据读成单向:回避高危是实锤,真实质量改进同样成立(Kolstad 2013);净福利取决于风险调整。 | K05 |
| 榜单出问题,改改评分方法就能修好 | 改良指标不等于消除反应性:修订本身立刻成为被博弈对象,指标与被测者共同演化。 | C08 |