为什么 Stratego 比围棋难对付
围棋和国际象棋是「完全信息」游戏,双方看到的棋盘一模一样。Stratego 和中国的军棋是近亲:你知道对方棋子在哪,但不知道它是司令还是炸弹,只有交战时才会亮牌。玩家要一边猜,一边故意让对方猜错。
这类问题以前主要靠扑克 AI 那套方法,但 Stratego 的隐藏状态比扑克大太多。论文资深作者、MIT 的 Gabriele Farina 直言,为扑克开发的技术「在这个规模上肯定扩展不了」。DeepMind 的 DeepNash 2022 年靠海量算力做到了人类顶尖水平附近,但没能稳定击败最强选手。
便宜,才是这篇论文的重点
Ataraxos 的突破不只是赢,而是用少得多的训练赢。它不靠训练时把所有情况算透,而是在每一步落子前临时规划:先猜对手手里最可能是什么牌,再在这些假设下推演。Farina 的说法是,与其盲猜,不如在决策时找出最合理的棋盘状态。
这对 AI 研究的意义在于:「训练时多学、推理时少算」的路线成本太高,把一部分计算挪到决策时,可以用小得多的训练预算解决信息不完全的问题。这和大模型领域把算力花在推理阶段的思路是一致的。
离实际应用还有多远
研究团队提到,谈判、网络安全这类需要在信息不全时做决策的场景是潜在用途。但他们也承认,系统目前很难解释自己为什么这么走,下一步要做可解释性,让人能审核它的建议,然后才谈得上实际使用。
边界说明:MIT 称「世锦赛期间 39 胜 2 负」,有报道指出这是在世锦赛期间与到场选手进行的表演性对局,并非参加并赢下正式人类赛事;研究团队未让 Ataraxos 与 DeepNash 直接对战,效率对比基于双方各自公开的训练规模。