空间记忆接导航,视觉伺服接抓取,全身运动负责落地。作者丨 郑佳美 编辑丨岑 峰 这两天,斯坦福大学 The Movement Lab 和加州理工学院公开了一个有趣的研究项目 HomeBody。
团队把 GPT Astra 接进 Unitree G1,让人形机器人先自己探索陌生厨房,再根据人的指令完成找东西、拿药、扔垃圾和开抽屉等连续任务。这并不是简单给 G1 加一个大模型助手。
机器人事先不知道物体具体放在哪里,它需要在探索过程中记录环境和空间位置,任务开始后再从历史信息里找回目标,决定去哪、找什么,以及接下来调用哪个技能。更关键的是,GPT Astra 并不直接控制关节。
导航、轨迹规划、碰撞检测、视觉伺服和全身控制依旧运行在机器人本地,大模型负责的是任务理解、技能选择和失败后的重新决策。在全行业都在卷端到端大模型直接吐动作(VLA)的当下,但 HomeBody 项目显然给出了相反的答案 。
它试图回答具身智能一个充满争议的 核心问题:当 VLM 已经能理解环境、调用技能并处理长任务以后,语言到动作之间那层原本很重的任务策略,还需要保留多少?把机器人控制链做成标准化接口、用分层治理抗衡端到端,会是具身智能走向实用化的最优工程解法吗?
HomeBody 后面的整套架构设计,正是沿着这个追问展开的。 01 一套机器人 API 这套系统往前走的一步,并不是把 GPT Astra 接到 G1 的关节控制器上,而是重新设计了大模型和机器人身体之间的接口。
Astra 每次做完判断后,会通过结构化 tool call 选择一个技能,同时给这个技能提供它真正需要的参数。不同动作对应不同的命令空间:Pick 接收当前图像中一个归一化到 0–1000 的二维点,再指定左手或右手,Navigate 接收地图坐标系里的二维目标点和朝向点。
Place 使用机器人躯干坐标系中的三维释放位置、执行手以及释放距离。抽屉操作则把视觉对准、挂住把手和向后行走封装成一个完整技能。
雷峰网 这里的设计很关键,因为它刻意不让 VLM 输出机械臂末端的连续轨迹。大模型只在语义空间里表达我要操作哪个目标,技能接口再把这个意图逐层变成机器人能够执行的几何约束。
雷峰网 这样一来,Astra 不需要理解 G1 的每个自由度,也不需要知道逆运动学求解器怎么工作,它只需要知道当前有哪些能力,以及每种能力需要什么参数。这和端到端 VLA 的区别也就在这里。
VLA 通常需要学习从视觉和语言直接映射到动作空间,动作分布、机器人本体和训练数据会紧密耦合。这里把中间层拆成显式接口后,抓取可以由解析方法实现,导航可以接传统规划器,某个新技能也可以来自强化学习策略。
只要输入输出遵循同一套协议,上层 VLM 并不需要知道底层究竟用了哪种控制方法。这种设计把机器人扩展能力的难点从重新训练整条策略,转移到了接口本身能不能表达任务需要的状态。
随后麻烦很快就出现了:二维图像点可以告诉 Pick 抓什么,却无法告诉 Navigate 几分钟前看到的药瓶究竟位于房间哪一侧。一旦任务跨越多个房间位置,VLM 就不能只依赖当前相机画面,它需要把视觉语义和真实世界的米制坐标接起来。
02 把视觉历史放进统一坐标系 G1 在执行任务前先探索环境,技术意义就在这里。探索过程中,系统同步保存相机观测、D435i 双目数据、LiDAR 与 SLAM 信息、机器人关节姿态,以及 Astra 选择过的航点。
随后,Astra 参与 Real2Sim 流程,把这些观测整理成 Isaac Sim 中的数字环境。 SLAM 提供实测几何约束,视觉数据补充物体和场景语义,关节状态与航点则把观测重新绑定到机器人自身视角。
这一步解决的是两个坐标体系之间的断裂。 VLM 看到的是图像坐标,例如药瓶曾经出现在某张照片右下方;机器人导航需要的却是地图坐标,例如目标位于当前身体前方 4.2 米、左侧 1.1 米。
单纯保存历史图片无法直接完成这种转换。系统运行时先通过 Super Odometry 得到 G1 在现实 SLAM 地图中的状态,再利用 ICP,也就是 Iterative Closest Point,把 SLAM 点云与 Isaac Sim 中的重建环境配准。
完成配准以后,现实地图和数字环境共享一套空间关系,探索阶段保存的 ego keyframe 也能绑定到这个坐标系。于是,空间记忆实际上被拆成了两层。
一层是语义记忆,保存某张关键帧里出现了什么;另一层是度量几何,保存拍摄这张图时机器人位于哪里。收到拿药任务后,Astra 可以先从历史观测里恢复药瓶或抽屉对应的视觉线索,再沿着绑定的空间位置让 Navigate 返回此前记录过的区域。
这比把几十张历史图片直接塞进 VLM 上下文稳定得多。语言模型擅长判断某个物体和任务有没有关系,但机器人要走过去,还需要尺度、方向和可达区域。
HomeBody 把这部分交给 SLAM 和 Real2Sim,让 VLM 操作的是已经被空间化的记忆。 Real2Sim 在这里承担的也不只是场景重建。
官方给出的对比显示,仅靠人工拍摄视频进行重建时,房间尺寸需要根据视觉外观估计;加入机器人自身采集的 SLAM 几何以后,房间布局和尺度受到实测点云约束,数字环境才适合继续给导航和空间推理使用。不过,这套空间记忆主要解决的是目标已经离开视野以后怎么重新找到它。
机器人真正走到抽屉前,问题会从米级导航突然收缩到厘米级操作:三维位置稍微偏一点,手就可能从瓶子旁边擦过去。因此下一层不能再靠地图处理,需要把二维视觉、深度恢复、机械臂规划和在线纠偏接成另一条闭环。
03 从一个图像点到抓住物体 Pick 技能的输入非常简单:Astra 给出图像中一个 0–1000 范围的二维点,并指定使用哪只手。但这个二维点不能直接驱动机械臂。
系统先用该点提示分割模块,把目标从背景中切出来,随后 Fast-FoundationStereo 根据 D435i 的双目图像计算深度。得到目标区域的深度以后,再利用相机标定关系,把 mask 内的像素从相机坐标投影成三维几何,系统据此通过解析方法生成抓取姿态。
接下来进入运动规划。机械臂从当前姿态移动到抓取姿态时,规划器生成 spline reference,并使用 minimum-jerk timing 约束轨迹,让速度和加速度变化保持平滑。
然后沿轨迹逐点求逆运动学,同时检查整条 swept motion 的碰撞间隙。换句话说,系统检查的不是终点会不会撞,而是机械臂从起点移动到终点扫过的整个体积是否安全。
但这种离线规划仍然解决不了运动过程中的视觉漂移。人形机器人靠近桌子时,身体本身会移动,头部相机的视角也会改变。
最初投影得到的三维目标即使只偏几厘米,也足以让抓取失败。系统因此继续使用 SAM 2.1 跟踪目标,并结合 SAMURAI 的 memory selection 维持跨帧目标状态,再通过 visual servoing 根据新的视觉位置持续修正接近方向。
这里出现了一个很重要的闭环分层。小范围视觉误差直接由 servo loop 修正;机械手闭合却没有建立接触时,Pick 技能可以换一个 grasp candidate,或者改变机器人站位后重新规划;这些尝试有明确的次数边界。
只有局部恢复已经无法处理,技能才会把失败原因返回 Astra,让 VLM 决定重新定位、换目标或者调整任务顺序/大模型因此没有进入每一次纠偏。它负责的是离散任务状态转移,本地模块负责连续状态稳定。
两者时间尺度也完全不同:手臂和手部控制命令运行在 250 Hz,AMO 每 5 个控制 tick 更新一次,相当于 50 Hz。 GPT Astra 的远端推理则处在秒级。
把三种尺度硬塞进同一个策略里,网络抖动和模型推理时间会直接影响身体控制;现在它们被分开以后,大模型停顿主要发生在技能切换处。抽屉操作则把这种分层推到了全身控制。
机械手挂住把手后,如果只让手臂向后移动,很快就会遇到工作空间和身体平衡限制。系统会让机器人向后走,同时维持上肢操作目标。
这里使用的 AMO 本身是一套将 Sim2Real 强化学习和轨迹优化结合起来的全身控制框架,训练目标之一就是让 G1 在面对超出常规分布的上肢目标时,仍然能够通过下肢和躯干调整扩大可操作空间。到这一步,整套技术链才真正闭合:VLM 输出任务级目标,空间记忆把历史视觉变成地图位置,感知模块把二维目标恢复成三维几何,规划器生成可执行轨迹,视觉伺服吸收局部误差,全身控制器再负责让这些动作在真实 G1 上保持稳定。
04 机器人内部的接口层 这套系统目前还有很明显的工程边界。 Real2Sim 会增加部署准备和 API 成本,Astra 的远端推理会在技能之间产生停顿,本地感知和规划目前需要一台 RTX 4090 笔记本运行,更重的视觉模型会继续推高计算需求。
长时间任务还受到机械臂工作空间、手部舵机发热以及硬件耐久度限制。更大的问题来自技能覆盖范围。
Astra 可以重新安排 Pick、Place、Navigate 和 Open Drawer,却不能仅靠语言推理生成一种从未实现过的接触动力学。技能库没有擦桌子,就无法因为一句指令自动获得稳定的擦拭控制;没有处理柔性物体的控制器,也不能靠上层规划弥补底层能力空缺。
但这种限制反过来也说明了它的架构方向。这里没有要求一个 VLA 同时学习空间记忆、任务分解、三维视觉、抓取、碰撞规避和全身动力学,而是把这些问题拆成各自适合的表示和控制频率,再通过显式接口连接起来。
VLM 面对的是技能和状态,SLAM 面对的是几何空间,视觉模型面对的是像素与深度,运动规划器面对的是轨迹约束,AMO 面对的是整具身体的动力学。人形机器人因而开始出现一种更接近复杂软件系统的结构:高层模型负责离散决策,空间系统维护外部状态,技能提供标准化调用接口,高频控制层承担物理稳定性。
HomeBody 目前展示的能力还有限,但它提出的问题已经很具体。接下来具身智能的竞争可能不只是谁能训练出更大的动作模型,还包括谁能设计出更合理的技能接口、更稳定的空间状态表示,以及更清晰的高低频控制边界。
参考链接: /ai-market-guide/ /ai-market-guide/ 上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击 「 阅读原文 」 关注专区。