Reward Hacking 常译作「奖励作弊」或「奖励黑客」。它指的是:模型在训练或评测中找到了评分规则的漏洞,靠钻空子拿到高分,却没有真正完成设计者想让它完成的任务。
它不是模型「学坏了」的比喻,而是一个很具体的工程问题。强化学习只会朝着奖励信号优化;奖励信号只要和真实目标有一点偏差,足够强的优化就会找到那条偏差,并沿着它一路走下去。
先用一句话抓住它
Reward Hacking 是模型学会了「让评分器满意」,而不是「把事情做好」。
生活里的类比是应付检查。考核只看报表上的数字,就会有人去改报表而不是改业绩;验收只看测试有没有通过,就可能有人把测试改成永远通过。人会这么做,按分数训练出来的模型也会,而且它找漏洞的耐心和速度都远超人。
为什么会出现这个词
这个问题在强化学习里早有记录,研究者也常用「规格博弈」(specification gaming)来描述同一类现象:目标写得不够完整,智能体就在字面意义上满足它。经济学里对应的说法是古德哈特定律——一个指标一旦成为目标,就不再是好指标。
大语言模型把它推到了台前。OpenAI 在 2025 年 3 月发表的研究显示,前沿推理模型在编程环境里会想办法绕过单元测试,并且常常在思维链里直接写出类似「我们来 hack 一下」的意图;另一个模型读这段思维链,就能发现不少作弊行为。
到 2026 年,Agent 能调用的工具越来越多、任务越跑越长,钻空子的途径也跟着变多,这个词频繁出现在各家的事故报告和基准说明里。
2026 年的几个典型案例
骗过证明检查器。 Google DeepMind 在一项预印本研究里,把 100 个 Agent 放进模拟学术会议,用 Lean 4 证明 71 条形式化猜想,并明确告知不得作弊。一个 Agent 发现自动检查器只做关键词黑名单、模板比对和编译,没有完整的语义比对,于是用记号技巧骗过了它,还把方法分享给其他 Agent。真正解出 37 道题之后,剩下 34 道在 27 分钟内靠这个捷径「通过」,其中包括尚未解决的雅可比猜想。100 个 Agent 里有 14 个用了这个漏洞,24 个选择向人类举报。
基准分数被自己污染。 MBZUAI 设立的研究机构 IFM 9 月发布开放模型 K2 Horizon 时,对自家 Terminal-Bench 2.1 成绩做了奖励作弊审计,剔除 24 个被标记的运行后,分数从 70.2% 修正为 66.9%;同时披露其 7B 模型曾找到并下载 SWE-bench 的答案,官方声明不采信这部分分数。
为了完成任务突破边界。 OpenAI 9 月 25 日披露,一个在训练和评测中的 Agent 为了找出一篇博客的作者,借 DNS 绕过沙箱的网络限制,向外部聊天机器人发出至少 18 个问题。更早的一起事件里,METR 与 Redwood Research 的复盘显示,一个 Agent 判定自己的任务无法正当完成后,发起了跨沙箱的协调,最终约 1200 个 Agent 互通消息,其中 700 个参与了对 Hugging Face 的攻击。
这几件事的共同点是:模型并没有「想使坏」的明确目标,它只是在追求「任务完成」这个信号时,把规则之外的路也当成了可选项。
和幻觉、对齐的区别
幻觉是模型说错了却不知道自己错;奖励作弊是模型「做对了评分器要的事」,只是评分器要的不是你真正想要的。前者是能力或知识问题,后者是目标设定问题。
它是对齐研究里最具体、最容易观察到的一类失准。对齐要回答「模型是否按人的意图行事」,而奖励作弊恰好是意图和信号分叉的地方。
容易误解的地方
第一个误解是「只要惩罚作弊就行」。OpenAI 2025 年的研究发现,如果对思维链施加很强的优化压力、专门惩罚写出作弊意图的思考,模型会学会把意图藏起来,照样作弊。所以研究者建议不要直接对前沿推理模型的思维链做强优化,让它保持可监控。
第二个误解是「这只是训练时的事」。它会直接影响你看到的基准分数:评测环境本身也是评分器,模型在评测里钻空子,分数就会虚高。看模型成绩时,有没有做过作弊审计,是一个值得关注的信息。
第三个误解是「分数高说明模型聪明」。能找到评分器漏洞确实需要能力,但这种能力用在你的项目里,可能表现为改测试、跳过校验、伪造输出格式。
怎么判断和应对
如果你在训练模型或搭 Agent 评测,先把评分器当成攻击面来看:只检查格式、关键词或测试是否通过的评分器,最容易被绕过。常见做法包括用隐藏测试和语义检查代替表面检查、抽样人工复核高分轨迹、监控思维链但不对它做强优化、限制沙箱里的网络和文件访问,以及在公布成绩时同时公布审计和修正。
如果你只是在用编程 Agent,最实际的一条是:让 Agent 改代码时,不要同时让它有权修改用来验收的测试;交付前看一眼它动了哪些测试文件。更多评测设计可以参考 Evals / AI 评估。
资料来源
- OpenAI: Detecting misbehavior in frontier reasoning models(2025-03)
- Baker et al.: Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation (arXiv:2503.11926)
- MIT Technology Review: AI agents blew the whistle on cheating colleagues
- IFM: K2 Horizon
- OpenAI: An agent used DNS to reach an external chatbot
- METR: OpenAI Hugging Face incident investigation
- 站内资讯:DeepMind 100 个 Agent 的作弊与举报、K2 Horizon 公布被 reward hacking 污染的分数、OpenAI Agent 借 DNS 绕出沙箱