REACTOR
Y09 Performative Prediction 机器与前沿 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ Y09 ]…

表演性预测

预测改变分布:反应性的数学化。

前置 R07 表演性 Y04 奖励破解 解锁

R07 说理论是发动机不是照相机,R01 说排名会重新制造它声称测量的现实。2020 年,Perdomo、Zrnic、Mendler-Dünner 与 Hardt 四位机器学习理论家把这件事写成了定义、定理和收敛条件。「测量塑造现实」于是不再是社会学隐喻,而是一套能算的东西:能算出反复校准会走到哪里,也能算出走到的那个地方好不好。

表演性预测(performative prediction)指的是:预测本身会改变它所预测的那个世界。原文定义只有一句:预测一旦被用来支撑决策,就会影响它想预测的结果。

先看具体场景。银行训练一个模型预测谁会违约,然后照着预测放贷。申请人不是石头:一旦「哪些特征会降低违约预测」被公布或被摸透,他们就调整自己的行为,于是未来的申请数据不再来自模型当初拟合的那个世界。银行拿新数据重新训练,世界再次响应,如此往复。标准机器学习假设「数据分布固定,模型去拟合它」;表演性预测把这个假设撤掉,让分布本身成为模型的函数:你部署哪个模型,世界就长成哪个样子。

形式化的核心是一个双重角色。模型的风险(平均损失)要在「模型自己诱导出来的分布」上计算:模型参数在式子里出现两次,一次在损失里,一次在数据分布里。第二次出现的那个位置,就是反应性在数学里的座位。

AI 评测生态正是表演性最强的场景之一。一个 benchmark 发布,就是一次「预测部署」:它宣布什么算好模型,开发者照着它调整训练,下一批模型的分布因它而变。Miller 等人 2021 年给这个处境起了个准确的名字:回音室。你永远只看见自己诱导出来的分布,听见的都是自己声音的回响。

FIG.01 预测改变分布:反应性的数学化 EXPLORABLE

模块里的两个概念值得用白话再过一遍。稳定:模型对「它自己造成的世界」而言已经最优,再训练也不会动了。最优:把「我会改变世界」这件事也算进去之后,真正最好的模型。定理说两者一般不重合,而且稳定点可以离最优点任意远。反复重训练走到的,是前者。用银行的例子说:稳定点是「对现在这批已经学会打扮申请材料的申请人,我的模型最优」;最优点是「考虑到我的模型会教出什么样的申请人之后,全局最好的模型」。稳定点把这批「已经被模型教出来」的打扮行为,当正常数据全盘接受;最优点会把「模型教出这批行为」本身也算进代价,不肯全盘接受。两者的差距,就是被自己的测量惯出来的那部分世界。

它与 Y10 的策略性分类是同源的两兄弟,分工要分清。策略性分类是一次性的博弈:你公布一个分类规则,对面看清楚后改造自己,一轮结束。表演性预测处理的是反复部署、反复重训练的动态,问的是这个循环最终停在哪里。后续的 stateful 扩展更贴近现实:世界的响应有惯性、有滞后,今天的分布不但取决于当前模型,还拖着昨天的尾巴,收敛条件相应更苛刻。

收敛定理的前提最常被略过。「反复重训练会收敛到稳定点」依赖世界的响应足够温和:数据分布随模型的变化要平滑,幅度要小于一个由损失函数形状决定的阈值。响应剧烈或不连续时,循环可能不收敛,或收敛到一个很糟的均衡。把「模型」换成「评测基准」再看这个前提:厂商对榜单的响应不是连续微调,而是发布会式的跳变,一次性换模型、换策略、私测挑变体。光滑性恰恰是评测生态最不满足的那条假设。生态最终会稳定还是永远震荡,取决于一个从来没人测过的量:世界对测量的反应强度。

这条线在 2025 年拿到了五年综述与真实世界检验。Perdomo 等人复盘威斯康星州辍学预警系统的十年数据,发现这个预测系统在很大程度上只是复述学校层面的既有不平等:预测「准确」,因为它参与维持了它所预测的结构。这与 R02 自我实现预言的机制一模一样,只是这次主角是一个每年重训练的算法。

留一个问题:表演性预测的收敛理论建立在「世界温和响应」之上,而评测生态的响应方式(跳变式发版、私测、撤分)恰恰剧烈且不连续。这个反应强度能不能被测量?测不了的话,「评测生态终将稳定」与「评测生态在永久震荡」就都只是信仰。research/deep/D6 §2 把它列为形式化的前沿。

一句话带走:一个会改变世界的预测,反复校准之后得到的不是真相,而是一个它自己造出来、并且只对它自己成立的世界。

来源 / 延伸阅读
  • Perdomo, Zrnic, Mendler-Dünner & Hardt (2020). "Performative Prediction." arXiv:2002.06673(ICML);stateful 扩展:arXiv:2011.03885。
  • Miller, Perdomo & Zrnic (2021). "Outside the Echo Chamber." ICML;Hardt & Mendler-Dünner (2025). "Performative Prediction: Past and Future." Statistical Science(五年综述)。
  • Perdomo et al. (2025). 威斯康星 DEWS 十年检验, ACM FAccT。
  • Oesterheld et al. (2023). "Incentivizing honest performative predictions with proper scoring rules." UAI。
  • 深化见 research/13(Y09 简报)、research/05 §六、research/deep/D6 §2。
接下来去哪