REACTOR
G02 Decoupling 防御与设计 · REV.3

SELF-TEST OK · REACTOR v3 · LOADING [ G02 ]…

解耦:Deming 与 POSIWID

别让 eval 分数直接驱动迭代。

一条最省心的规矩:别让 eval 分数直接决定要不要改、怎么改。分数一旦挂上利益,被测的东西就学会专门讨好分数,而不是把事做好。把「测量」和「奖惩」拆开,让 eval 只当体检报告、别当自动发奖的机器,这个动作叫解耦。

你在 B11 见过必要多样性:一把太简单的尺子,管不住一个复杂的系统。R09 的审计社会也讲过,当「让别人能审计你」本身变成了目的,事情就开始走形。解耦就是把这两条落成一个能马上做的动作。

先看一个老实验。质量管理宗师 Deming 让工人拿一把带孔的木铲,从红白珠子混在一起的桶里舀珠,红珠算次品。可红珠舀上来多少,纯看这一铲的运气,工人再用心也控制不了。偏偏管理层每天照样评「今天谁最好、谁最差」,表扬一批、训一批。Deming 的意思很直白:在一个由系统和运气决定结果的地方,给个人排名奖惩,是把运气当本事在奖罚,既不公平也没用。

他还有个漏斗实验,讲的是另一半。拿漏斗往靶心投珠,如果你每次都盯着上一次偏了多少去反向纠偏,结果反而越投越散;老老实实不动漏斗,反而最准。把每次 eval 分数的小抖动拿去即时调参,就是这种越调越糟的乱调,你是在拿噪声当信号。

「分数一挂上利益就被讨好」不是空话,两个现成的例子。英国 NHS 曾给急诊定过「四小时内处理完」的硬目标并跟考核挂钩,结果有的医院把病人留在救护车里、不让进急诊大门,因为计时从进门才开始,这样账面上就没超过四小时,可病人并没有被更快救治。AI 这边也一样,有的排行榜上厂商私下测很多版本、只把分最高的那版挂出来,模型还会慢慢学会迎合打分的人,回答越写越长、越写越顺耳,分数涨了、真本事没涨。共同点是:只要分数背后连着实打实的后果,被测的一方就会把力气花在讨好分数上。

再说个更硬的道理:为什么一个指标管不住一个通用系统,这不是「指标没设计好」,是数学上就办不到。控制论有条定律说,一个调节器能压住多少种乱七八糟的情况,取决于它自己有多少「花样」。一个分数只有高低一个自由度,花样极少;而一个通用系统能在成千上万个方向上表现,花样极多。两边一比,你其实只按住了被测的那一个方向;系统在所有没被测的方向上,照样乱跑。而「迎合被测的、牺牲没测的」,正好就是博弈的定义。想真管住,要么把尺子做成一组、多个方向一起测(这是 G04 的活),要么认了系统会在没测的地方漂,没有第三条路。

FIG.01 解耦:Deming 与 POSIWID EXPLORABLE

把上面几条拧成一个处方,就叫解耦:eval 只用来看趋势、找毛病、提问题,不直接拿去决定奖惩和改动方向。Carter 有个好比喻,大多数指标其实是开罐器,作用是撬开一罐问题、逼你追问「这个数怎么这么怪」,而不是仪表盘,读个数就直接拨方向盘。一旦你把指标当仪表盘用、还接上后果,从数字到奖惩就成了一条机械链路,而正是这条机械链路让博弈有利可图。把它改成「数字异常就触发人工深挖」,操纵单个数字的期望收益立刻掉下来。

但解耦不是设一次就一劳永逸,它自己会往回退。英国 NHS 的复盘记录了一个典型:本来说好「这个指标只是看看、不考核」,可制度一有压力,它就慢慢被塞进年度考核,开罐器又变回了仪表盘。还有一层更绕的自省,叫 Shirky 原则:一个靠「治理 eval 毛病」立身的团队,它的饭碗其实依赖毛病一直存在,于是它可能不知不觉把问题养着。所以解耦是要持续维护的纪律,得定期轮换、找外部独立的人来看、连你这套 eval 本身产出了什么也要拿去审,这条接 G06 的制度层。

落到手上,解耦就三步:

  • 分开两张表:一张是诊断表,eval 告诉你哪里可能有问题;另一张是决策,由人看着诊断表决定改什么、怎么改。两张表别合并。
  • 异常先追问、不自动结算:分数突然变好或变差,第一反应是去问「为什么」、去深挖,而不是自动放行或自动扣分。
  • 定期做一次 POSIWID 体检:隔一阵问一句,我这套 eval 这段时间实际在生产什么样的模型?把最近几版被判「优秀」的输出摊开看,它们是真变好了,还是只在讨好这套判据?如果答案是「更长、更会讨好、专门刷这套题」,那它已经不是你的工具了。

留一个问题:开罐器退化成仪表盘,好像总在发生,那它可逆吗?有没有一种制度设计能让一个指标稳稳停在开罐器的位置,比如用规则明文禁止把它绑上自动奖惩?这是把「解耦」从一句口号变成可执行制度的关键缺口,D7 报告把它列为开放问题。

一句话带走:eval 是体检报告,不是发奖机器;分数一挂上利益,被测的东西就开始讨好分数。

来源 / 延伸阅读
  • Deming, W. E. Out of the Crisis (1986)(14 要点、七大致命病、p.121 Nelson 引语、红珠与漏斗实验); The New Economics (1993)(costly myth 原话)。
  • Ashby, W. R. (1956). An Introduction to Cybernetics, ch.11 "Requisite Variety"(一个低多样性调节器压不住高多样性系统)。
  • Beer, S. (2002). "What is cybernetics?" Kybernetes 31(2):209–219;The Heart of Enterprise (1979)(POSIWID 短语出处)。
  • Carter, N. (1991). "Learning to measure performance: the use of indicators in organizations." Public Administration 69(1):85–101(tin openers vs dials)。
  • Klein, R. (2025). "The politics of reinvention"(NHS:开罐器退化成仪表盘的实证);Shirky 原则 — Kelly, K. (2010), The Technium
  • Berenson, R. A. (2016). "If You Can't Measure Performance, Can You Improve It?" JAMA 315(7):645–646。
  • 主源 research/08(Ashby、Deming、POSIWID、tin opener 考证)与 research/deep/D7 §4(讹传法证与退化风险)。
接下来去哪
继续往下探索