一颗星值多少钱?经济学家 Michael Luca 给出过精确答案:Yelp(美国版大众点评)星级每提高一星,餐厅营收上升约 5% 到 9%。他用的识别办法叫回归断点:Yelp 显示的星级按四舍五入取整,真实均分 3.24 和 3.26 的两家餐厅,真实质量几乎一样好,取整线却把它们分到了两边,显示出来成了 3 星与 3.5 星。这两家餐厅之间唯一的差别,就只剩显示的星级本身,于是比较取整线两侧的营收,比出来的就是评分本身的因果效应,跟餐厅真实好坏无关。更妙的是,这个效应只存在于独立餐厅,连锁店不受影响。连锁店本来就有全国招牌撑着口碑,顾客心里早有数;独立餐厅没有这块招牌,星级评分就是顾客能拿到手的唯一外部信号。说明在线评分顶替的正是传统口碑。评分不只反映生意,评分制造生意,这是你在 R08 学过的反身性在消费市场里的直接测量。而市场评分与其他领域的根本差别就在这里:博弈的回报可以精确计价。一旦一颗星有了明码的营收价值,假评论就成了一件有明确回报率的投资品。有回报率摆在那儿,刷单从个体越轨长成产业,只是时间问题。从刷单产业链到 LIBOR(被博弈出天价罚单的金融基准利率),再到信用评分下的策略性行为,三层是同一件事:信号有价,则信号必被生产。
刷单产业链:供给、需求与执法
产业链的每一环都有执法或研究档案。平台内的规模估计:Luca & Zervas 发现约 16% 的 Yelp 餐厅评论被过滤算法标记为可疑,也就是每六七条评论里就有一条疑似假货;且声誉薄弱(评论少、近期差评)的商家更可能造假,竞争越激烈的商家越可能被投放虚假差评。造假是对处境的理性反应,方向由竞争结构决定。平台外的供给侧:2022 年亚马逊起诉逾 1 万个 Facebook 假评论中介群组的运营者,其中一个群组被关停前有逾 4.3 万名成员;中国的刷单灰产已成完整链条,据执法数据的媒体转述,一款刷单 App 曾对接逾 3.6 万家电商与 60 万名刷手,制造超 2 亿笔虚假订单(单一来源,按存疑证据处理)。六十万人的「就业规模」,说明这已经是一个行业,不是一撮骗子。社媒指标的对应物是 Devumi 案:这家公司掌握至少 350 万个机器人账号,向约 20 万客户售出超 2 亿个粉丝,其中至少 5.5 万个假号盗用真实用户的姓名与头像;纽约州总检察长 2019 年的和解首次认定出售虚假社媒互动违法。监管的修补线随后拉直:FTC(美国联邦贸易委员会)2019 年首罚付费假评论(1280 万美元),2022 年就隐藏差评与 Fashion Nova 和解 420 万美元,2024 年 8 月发布《消费者评论与推荐最终规则》,全面禁止买卖虚假评论,每次违规最高罚 51,744 美元。机制标注:直接造假与规则套利,监管以立法事后封堵。
双向的战场
评分操纵是双向武器,抬自己和砸对手用的是同一批账号。豆瓣的毕志飞案两头都有档案:导演起诉平台「锁定最低分」逼迫撤档,法院认定证据不足驳回;同一平台又常年被反向刷分,某剧开播前 6 小时涌入 6752 条五星评价,一星仅 649 条,水军按账号质量分级报价。剧还没播完一集,评价已经写好了,分布本身就是供词。Rotten Tomatoes(美国影评聚合站)同样两头占全:公关公司 Bunker 15 以每篇约 50 美元招募边缘影评人抬分,一部影片的新鲜度从 46%(烂)做到 62%(新鲜);反向则有《Captain Marvel》上映前的评分轰炸,观众分一度被刷到 33%,平台清除约 5.4 万条评论并从此禁止上映前打分。畅销书榜的套利更直接:营销公司按合同收费约 21 万美元,用协调化批量购书把一本书送上纽约时报榜首,次周即跌出前十。只在榜上停留一周的「畅销书」,买的不是读者,是榜位本身的广告价值。机制标注:直接造假与刷分,且攻防双方在同一个市场采购弹药。
LIBOR:自报基准的天价终局
把「评分被博弈」放大到金融基础设施的尺度,就是 LIBOR。这个基准利率为数百万亿美元级的合同定价(Wheatley Review 常引口径约 300 万亿美元,房贷、企业贷、衍生品都挂在它身上),生成方式却简陋得惊人:面板银行每天自报「你能以什么利率借入资金」的估计值,掐头去尾取平均。不基于实际交易,纯自我申报。K01 案例库的第二定律(自我申报等于造假温床)在此应验成天价。操纵分两型:交易员为衍生品头寸微调本行报价,属于顺手牵羊;危机期间银行整体压低报价,以免高利率暴露自身的融资困境,属于集体求生。2012 年 6 月 Barclays 率先与英美监管当局和解约 4.5 亿美元,CEO 辞职;随后 UBS、RBS、Deutsche Bank(2015 年 25 亿美元)等相继和解,行业累计罚没常被引为约 90 亿美元。个人刑责一波三折:交易员 Tom Hayes 2015 年成为首个被定罪的个人,初判 14 年监禁,2025 年 7 月英国最高法院以陪审团指引失当为由撤销其定罪。制度终局最能说明问题:治理改革救不回这个基准,LIBOR 被整体废止,美元面板 2023 年 6 月停止发布,继任基准(如美元的 SOFR)改从实际交易数据计算。修不好,只能换信号源:当一个测量被博弈到不可修补,唯一的防御是换一个不可自报的信号。机制标注:对抗型 Goodhart 的顶格案例。此为课程补充案例,事实取自监管处罚公告与 Wheatley Review,未入研究底稿,证据分级见来源。
信用评分:被测者的理性改造
信用评分是市场评分的镜像面:不是商家刷高自己的分,而是被评者按公开规则改造自己,这正是 Y10 策略性分类的原型场景。把还款概率的预测模型公开,申请人有两条路:一条是 gaming,塞进能骗过模型的表面特征(关键词、临时刷流水),预测变好而真实信用没变;一条是 improvement,真的攒下储蓄、降低负债,真值随之变好。Hardt 等 2016 年把它形式化为 Stackelberg 博弈(一方先公布规则、另一方看着规则接招的先后手博弈)并证明,朴素分类器在博弈下性能急剧退化。后续工作补了两刀:区分 gaming 与 improvement 本质上是因果推断问题(哪些特征是真值的因,哪些只是相关);而机构为防博弈,会把门槛抬到博弈最优的位置:光靠表面手脚已经骗不过关,要合格就得真做出改变。真做改变是要花成本的,这笔成本机构不担,落在被分类者自己身上。改造特征的成本却不是人人一样,弱势群体改起来更贵、负担更重。防博弈的账单,最后落在了最没能力博弈的人头上。机构级的评分通胀给这条线收尾:2008 年前的评级机构在 issuer-pays(发行方付费请人给自己打分)结构下,把 AAA 评到「平均只有 BBB 支撑」的水平(Griffin & Tang 对 916 个 CDO 的计量),终局是 S&P 13.75 亿、Moody's 8.64 亿美元的司法和解。市场把每一种评分都变成价格,因此也把每一种评分都变成靶子。
留一个问题:平台已开始把非互动信号(用户调查、质量代理)掺进排序以对冲刷分,但这些新信号是否只是下一轮博弈的靶子?刷调查与伪造质量信号的成本并不高,而不可自报的信号清单看起来正越用越短。
一句话带走:评分一旦能换钱,就一定有人生产评分;防线不在道德呼吁,在改写造假的供需曲线。
来源 / 延伸阅读
- Luca, M. (2011/2016). "Reviews, Reputation, and Revenue: The Case of Yelp.com." HBS Working Paper 12-016。
- Luca, M. & Zervas, G. (2016). "Fake It Till You Make It: Reputation, Competition, and Yelp Review Fraud." Management Science。
- FTC:Cure Encapsulations(2019)、Fashion Nova(2022)、《消费者评论与推荐最终规则》(2024-08);亚马逊诉假评论群组公告(2022);Devumi:NY AG 和解(2019)、FTC(2019)。
- 豆瓣案:中新网(2018-08);水军报价:界面新闻。Rotten Tomatoes:Vulture/TheWrap(2023);畅销榜:Christianity Today(2014,ResultSource 合同)。
- LIBOR(课程补充,未入研究底稿):FSA/CFTC/DOJ 对 Barclays 的处罚公告(2012);Wheatley Review (2012);英国最高法院 Hayes 案裁决(2025-07)。
- Hardt, M., Megiddo, N., Papadimitriou, C. & Wootters, M. (2016). "Strategic Classification." ITCS;Miller, Milli & Hardt (2020), ICML;Milli, S. et al. (2019). "The Social Cost of Strategic Classification." FAT*。
- Griffin, J. & Tang, D. (2012). "Did Subjectivity Play a Role in CDO Credit Ratings?" Journal of Finance;DOJ 对 S&P(2015)、Moody's(2017)的和解公告。
- 底稿:
research/04-cases-across-domains.md§4A、§6–7、§9;research/05-ai-evals-reactivity.md(策略性分类);research/deep/D6子主线 3;research/deep/D3子主线 5–6。