B09 讲了跨任务的挤占:考核甲,乙遭殃。还有一个更尖锐的问题:就算只剩一个任务,一个便宜、精确、人人服气的指标,也可能是坏指标。George Baker 1992 年证明了这一点,并且给出「好指标」的真正判据。直觉说噪声小的指标好,Baker 说不对:好坏不看测得准不准,看指标指的方向对不对。
先建立画面。你的每一个动作都会同时牵动两个数:真实价值(你老板真正在乎的东西)动一点,绩效指标(合同里写的那个数)也动一点。理想的指标是个忠实的影子:无论你做什么动作,影子和本体总是同方向、同比例地动。坏指标是个哈哈镜:某些动作在镜子里被放大,另一些被缩小。而你在乎的,正是镜子里的样子——毕竟报酬是按这个数字算的。于是你会不由自主地专挑「镜中效果好」的动作做。Baker 把这面镜子的畸变程度做成了数学量:动作对指标的边际影响,与动作对价值的边际影响,两者的相关度(记作 ρ(P′, V′))。相关度等于一,镜子是平的;越低,哈哈镜越弯。
论文里最有说服力的是一对双胞胎公司(第 610 至 611 页)。两家都给销售员按收入提成,收入这个数在两家同样便宜、同样好测。Firm A 里,销售员的努力只影响卖出多少,企业价值也只由卖出多少决定。于是收入的每一分变动,都忠实对应企业价值的变动——镜子是平的。镜子既然是平的,提成比例就可以拉满,皆大欢喜,经济学称之为 first-best(第一优解)。Firm B 里,销售员的行为还会影响成本,比如为了成单乱承诺加急交付,收入照涨、利润暗亏——收入的变动不再忠实对应价值的变动,镜子弯了。镜子一弯,最优提成比例就要掉到一以下。同样的可测性,相反的结论。这个对照实验式的例子说明,「好不好测」根本不在判据里。
另一处经典是按专利数计酬的研发科学家(第 609 页)。专利有难有易,容易的专利在指标里和困难的专利一样值钱,但对企业的真实价值远远不如。于是科学家会在容易的专利上投入过多、在难而重要的问题上投入过少。注意,这不是伪造数据,每一份专利都是真的;他只是专挑镜中效果好的动作做。Baker 把这类行为正式定义为 gaming:利用那些指标响应大于价值响应的状态。而公司的最优反应不是道德教育,是把计件率压低。第 600 页给整个现象下的定义同样干净:那些提高合同支付、却不改善真实绩效的行动。这就是 Goodhart 定律的合同版:扭曲损失随激励强度连续放大。所以「不要全力优化一个有偏的指标」不是劝告,是最优合约自带的性质。
形式结果可以只记两条。第一,最优提成率有闭式解(第 605 页式 8):分子是「指标边际响应与价值边际响应的协方差」加一,分母是「指标边际响应的方差」加一。方向越对齐,提成越可以放心给;方向越歪,越要收着。第二,第 605 页有句常被漏读的话:价值可以比指标波动大得多,都没关系,只要那些波动不改变代理人该做什么。噪声大不要紧,因为噪声骗不了人的行动;方向歪才要命,因为方向每天都在悄悄指挥人的行动。风险中性时结论照样成立(摘要原话:即使代理人风险中性,这类合同一般也达不到第一优)。所以这不是「人怕风险」的老故事,是纯粹的对齐失败。
后续文献把这两种病灶的解剖做得更细。Baker 自己 2002 年的续作把指标缺陷正式分解成 risk(噪声)与 distortion(扭曲)两个正交分量,各自以不同方式进入最优合同:噪声压低你敢给的激励强度,扭曲则把给出去的激励引向歧途。会计学家 Feltham 与 Xie 早在 1994 年就给两个病灶起了学名并证明其独立性:congruity 缺失(指标向量与价值向量方向不对齐)扭曲努力的配置,noise 压低努力的强度。由此得到一个好用的心算公式:一个指标被 Goodhart 的程度,约等于它的方向缺口乘以压在它上面的激励强度。这也顺手解释了加权综合指标为什么危险:调任何一个权重,都在转动整个指标向量的方向,而要与高维的真实价值对齐,几乎不可能。
还有两条推论值得带走。其一,相对绩效评估(拿同行当基准扣减)并不自动免疫:第 611 页证明,只有当基准不受你的行动影响时才无扭曲,否则「压低同行」会成为新的镜中动作。其二,Baker 的单任务模型与多任务模型(B09)其实等价,两篇论文在脚注里互相认领(Baker 第 603 页脚注 6,HM 第 34 页脚注 11):跨任务的挤占与任务内的歪斜,是同一枚硬币的两面,共同的非平凡结论是失效与风险无关。
留一个问题:方向缺口(congruity)在理论里是个干净的量,但没人知道怎么从数据估计它。给定一个 benchmark 和一个真实部署目标,能否在优化开始之前测出两者的方向缺口,从而预报这个 eval 会被 Goodhart 到什么程度?D6 报告认为,这一步是把「事前判断指标好坏」从手艺变成科学缺的那块拼图,目前没有成熟方法。
一句话带走:坏指标不是测不准的指标,是指错方向的指标;越稳定、越受信任的错方向,伤害越大。
来源 / 延伸阅读
- Baker, G. (1992). "Incentive Contracts and Performance Measurement." JPE 100(3):598–614(b* 公式 eq.8 p.605;gaming 定义 p.609;Firm A/B p.610–611);Baker (2002). JHR 37(4)(risk 与 distortion 正交分解)。
- Feltham, G. A. & Xie, J. (1994). The Accounting Review 69(3):429–453(congruity 与 noise 命名)。
- Budde, J. (2007). J. Accounting Research 45(3)(平衡计分卡的限度)。
- Gibbons, R. (1998). JEP 12(4)(与多任务模型的整合叙事)。
- 逐页笔记见
research/03b;深化见research/deep/D6§1;信度-效度映射见research/06§4。