它问的问题是:中间那层还需要吗
过去两年人形机器人的主流做法是分三层:上面一个大模型负责理解指令、拆任务;中间一个专门训练的 VLA 模型,把「拿起那个杯子」变成具体动作;最下面是控制器,管关节和平衡。中间那层最贵——要为它采集大量机器人演示数据。 HomeBody 的问题很直接:**如果最上面的模型已经足够聪明,能不能跳过中间层,让它直接调用一组写好的技能?**他们给的技能只有 5 个:导航、抓、放、开抽屉、从抽屉里拿东西,底下用现成的全身控制器和经典运动规划。GPT Astra 在远端被调用,像调工具一样一步步选技能,执行结果回传给它,出错就重新规划。
真正起作用的可能是「记忆」
光靠模型聪明不够。机器人转个身,刚才看到的东西就出了视野;房间大一点,它就不知道自己在哪。 HomeBody 的做法是先让机器人把厨房走一遍,收集视频、深度和激光雷达数据,在 Isaac Sim 里重建一个数字孪生,再把「什么东西在哪」写进持久的空间记忆。之后收到「把我的药拿来」这种没说清在哪的指令,它可以查记忆,知道药在某个抽屉里,再去开抽屉取。**这一步把「看得懂」变成了「记得住」,对家务这种跨整个房间的长任务,后者往往才是卡点。**
为什么要把局限读完
这是一个演示,不是一个评测结果。项目页没有报告成功率,也没有和 VLA 方案做系统对比,所以「不需要中间层」目前只能读成「在这些演示里可以不用」。 作者自己列的局限也很具体:每换一个环境都要先重建,有准备时间和 API 成本;Astra 每一步都要想一会儿,技能之间有停顿;手指舵机跑久了会过热,限制了任务长度;本地部分要一块 RTX 4090 笔记本显卡。**把这些加起来,它离「买回家就能用」还很远,更像是在给「大模型 + 少量技能 + 空间记忆」这条路线做可行性验证。** 还要澄清一点:有报道称代码已开源,但 GitHub 仓库目前只有 README 和图片,写的是「代码即将发布」,也没有许可证文件。
对读者的实用含义
对做机器人或具身智能的团队,这个项目值得关注的是架构取舍:用前沿模型的推理加一小组可靠技能,换掉需要大量演示数据的 VLA。如果这条路走得通,数据门槛会大幅降低;但代价是每一步都依赖远端大模型的延迟和费用。等代码和成功率公开之后,才适合判断它能不能复现。