安全员以为车是看见骑行者才停的,其实不是:MIT 与 Motional 的可解释规划器登上 Nature

1 查看

9 月 2 日,MIT CSAIL 与自动驾驶公司 Motional 在 Nature 发表 Concept-Wrapper Network(CW-Net):把训练好的运动规划器最后一层换成「概念分类器 + 新的决策层」,其余网络不动,用 1.3 亿个带标注的驾驶场景联合训练,让车的每次决策直接建立在「接近停止车辆」「靠近骑行者」这类人能读懂的概念上,并实时显示出来。在拉斯维加斯的实车测试中,这套解释暴露了一件事:车每次接近骑行者都会停,安全员一直以为是识别到了骑行者,CW-Net 显示模型其实没能正确检测到,是兜底的应急制动在起作用。团队称加装后与主流自动驾驶算法的性能差距小于 1%。

那个骑行者的例子

值得先讲结论怎么来的。测试车每次接近骑行者都会停下,行为看上去完全正确,安全员的解读也很自然——车看见了,所以停了。装上 CW-Net 之后才发现,触发制动的概念不是「靠近骑行者」,模型并没有把这个骑行者正确检测出来,停车来自兜底的应急制动系统。 这条信息的价值不在于抓到一个 bug,而在于它纠正了人对系统的判断。安全员此后在骑行者场景下更谨慎,后续分析显示这份谨慎是必要的。换句话说,一个「表现正确」的系统可以长期让人建立错误的信任,而只看轨迹是发现不了的。

它和「让模型解释自己」不是一回事

技术上,CW-Net 的做法相当克制:取一个用逆强化学习模仿人类驾驶训练出来的运动规划器,把最后那层奖励层换成一个概念分类器再接一层新的奖励层,两者联合训练去同时预测场景类型和驾驶决策,网络的其余部分一动不动。训练数据是 1.3 亿个驾驶场景样本,每个都带有周边车辆、骑行者、路况这类要素的标注。 关键差别在于因果方向。常见的做法是让另一个模型事后生成一句自然语言解释——读起来合理,但不保证和真正驱动决策的东西有关。CW-Net 是把这些概念放进决策链路本身,最终动作就建立在它们之上,所以一次刹车能回溯到具体是哪个概念触发的。团队把这个性质叫作因果忠实。 代价方面,论文给的口径是与领先的自动驾驶算法相比性能差距小于 1%——CW-Net 被要求同时复制原规划器的驾驶行为,加解释不以牺牲驾驶质量为前提。

不只是自动驾驶的事

第一作者 Eoin Kenny(当时为 MIT 博士后,现任摩根大通资深 AI 研究员)的说法是:与其事后猜车为什么停了,实时数据让你能在部署过程中检验这套系统。共同作者 Julie Shah 说得更直接——如果我们造这些技术的方式没法让人依赖和预测它们的行为,那这个基础是不牢靠的。 对做 agent 的人,这篇论文提出的其实是同一个选择题:是让模型事后写一段解释,还是把系统的最终决策建立在一组人能读懂、也能被检验的中间概念上。前者便宜,后者要改结构、要标数据,但只有后者能告诉你「它到底是按什么做的决定」。Motional 方面预计,随着监管收紧,这类工具会变成安全攸关系统的基本要求。

via: MIT News《System helps humans predict when self-driving cars will make mistakes》AI News 报道arXiv 预印本 2411.18714