那个骑行者的例子
值得先讲结论怎么来的。测试车每次接近骑行者都会停下,行为看上去完全正确,安全员的解读也很自然——车看见了,所以停了。装上 CW-Net 之后才发现,触发制动的概念不是「靠近骑行者」,模型并没有把这个骑行者正确检测出来,停车来自兜底的应急制动系统。 这条信息的价值不在于抓到一个 bug,而在于它纠正了人对系统的判断。安全员此后在骑行者场景下更谨慎,后续分析显示这份谨慎是必要的。换句话说,一个「表现正确」的系统可以长期让人建立错误的信任,而只看轨迹是发现不了的。
它和「让模型解释自己」不是一回事
技术上,CW-Net 的做法相当克制:取一个用逆强化学习模仿人类驾驶训练出来的运动规划器,把最后那层奖励层换成一个概念分类器再接一层新的奖励层,两者联合训练去同时预测场景类型和驾驶决策,网络的其余部分一动不动。训练数据是 1.3 亿个驾驶场景样本,每个都带有周边车辆、骑行者、路况这类要素的标注。 关键差别在于因果方向。常见的做法是让另一个模型事后生成一句自然语言解释——读起来合理,但不保证和真正驱动决策的东西有关。CW-Net 是把这些概念放进决策链路本身,最终动作就建立在它们之上,所以一次刹车能回溯到具体是哪个概念触发的。团队把这个性质叫作因果忠实。 代价方面,论文给的口径是与领先的自动驾驶算法相比性能差距小于 1%——CW-Net 被要求同时复制原规划器的驾驶行为,加解释不以牺牲驾驶质量为前提。
不只是自动驾驶的事
第一作者 Eoin Kenny(当时为 MIT 博士后,现任摩根大通资深 AI 研究员)的说法是:与其事后猜车为什么停了,实时数据让你能在部署过程中检验这套系统。共同作者 Julie Shah 说得更直接——如果我们造这些技术的方式没法让人依赖和预测它们的行为,那这个基础是不牢靠的。 对做 agent 的人,这篇论文提出的其实是同一个选择题:是让模型事后写一段解释,还是把系统的最终决策建立在一组人能读懂、也能被检验的中间概念上。前者便宜,后者要改结构、要标数据,但只有后者能告诉你「它到底是按什么做的决定」。Motional 方面预计,随着监管收紧,这类工具会变成安全攸关系统的基本要求。
via: MIT News《System helps humans predict when self-driving cars will make mistakes》、AI News 报道、arXiv 预印本 2411.18714