斯坦福让 GPT-6 Astra 直接指挥人形机器人收拾陌生厨房,中间没有训练专门的动作模型,但也没给成功率

斯坦福大学 Movement Lab 与加州理工学院的研究者于 9 月发布 HomeBody 项目,作者为 Gio Huh(加州理工)、Cayden Gu、Takara E. Truong、C. Karen Liu 与 Guy Tevet(斯坦福,后两位共同指导)。常见的人形机器人架构是「视觉语言模型负责推理 → 视觉-语言-动作模型(VLA)负责动作 → 底层控制器」三层;HomeBody 去掉了中间需要专门训练的 VLA,让前沿视觉语言模型 GPT Astra 通过结构化工具调用,直接组合 5 个技能:导航、抓取、放置、开抽屉、从抽屉中取物。机器人先探索环境,采集视频、深度相机、激光雷达与 SLAM 数据,由 Astra 协助在英伟达 Isaac Sim 中重建厨房的数字孪生,并把观察到的物体和位置写入持久的空间记忆,因此能找到已离开视野的物品。项目页称,在一个此前没见过的厨房里,由 Astra 指挥的宇树 G1 能完成「把咖啡袋收到中间、扔掉变质的牛奶和橙汁盒」这类跨整个房间的清理,并根据含糊的指令找回记住位置的药品,过程中没有使用该环境的专门训练数据或额外的策略学习。项目页未报告成功率或系统性评测,只给出演示;作者列出的局限包括重建带来的准备时间和 API 成本、Astra 推理延迟造成技能之间的停顿、手指舵机长时间运行过热,以及本地部分需要一块 RTX 4090 笔记本显卡。GitHub 仓库目前只有 README 与图片,写明「代码即将发布」,未附许可证。

它问的问题是:中间那层还需要吗

过去两年人形机器人的主流做法是分三层:上面一个大模型负责理解指令、拆任务;中间一个专门训练的 VLA 模型,把「拿起那个杯子」变成具体动作;最下面是控制器,管关节和平衡。中间那层最贵——要为它采集大量机器人演示数据。 HomeBody 的问题很直接:**如果最上面的模型已经足够聪明,能不能跳过中间层,让它直接调用一组写好的技能?**他们给的技能只有 5 个:导航、抓、放、开抽屉、从抽屉里拿东西,底下用现成的全身控制器和经典运动规划。GPT Astra 在远端被调用,像调工具一样一步步选技能,执行结果回传给它,出错就重新规划。

真正起作用的可能是「记忆」

光靠模型聪明不够。机器人转个身,刚才看到的东西就出了视野;房间大一点,它就不知道自己在哪。 HomeBody 的做法是先让机器人把厨房走一遍,收集视频、深度和激光雷达数据,在 Isaac Sim 里重建一个数字孪生,再把「什么东西在哪」写进持久的空间记忆。之后收到「把我的药拿来」这种没说清在哪的指令,它可以查记忆,知道药在某个抽屉里,再去开抽屉取。**这一步把「看得懂」变成了「记得住」,对家务这种跨整个房间的长任务,后者往往才是卡点。**

为什么要把局限读完

这是一个演示,不是一个评测结果。项目页没有报告成功率,也没有和 VLA 方案做系统对比,所以「不需要中间层」目前只能读成「在这些演示里可以不用」。 作者自己列的局限也很具体:每换一个环境都要先重建,有准备时间和 API 成本;Astra 每一步都要想一会儿,技能之间有停顿;手指舵机跑久了会过热,限制了任务长度;本地部分要一块 RTX 4090 笔记本显卡。**把这些加起来,它离「买回家就能用」还很远,更像是在给「大模型 + 少量技能 + 空间记忆」这条路线做可行性验证。** 还要澄清一点:有报道称代码已开源,但 GitHub 仓库目前只有 README 和图片,写的是「代码即将发布」,也没有许可证文件。

对读者的实用含义

对做机器人或具身智能的团队,这个项目值得关注的是架构取舍:用前沿模型的推理加一小组可靠技能,换掉需要大量演示数据的 VLA。如果这条路走得通,数据门槛会大幅降低;但代价是每一步都依赖远端大模型的延迟和费用。等代码和成功率公开之后,才适合判断它能不能复现。

via: HomeBody 项目页、HomeBody GitHub 仓库、The Decoder 报道