用像素坐标加绝对深度表示轨迹,换本体不必重训模型。作者丨 张 璐 编辑丨 幸丽娟 试想,对一个家庭服务机器人下达指令: 拿水壶从左到右依次给花浇水,喷头需悬停在每朵花上方 1 到 5 厘米处。
这个指令看似日常,对现在的具身系统却很苛刻:既要分清花的左右顺序,又要把喷头停在每朵花上方约 1–5 厘米。 2D 轨迹一旦深度估错,喷头要么砸到花盆,要么对着空气做无用功。
带绝对尺度和避障约束的指令,是当前系统的常见短板。一方面,端到端的视觉-语言-动作模型 (VLA) 可以直接输出动作,但真机示教成本高,换物体、换距离后容易失效。
另一方面,通用视觉语言模型(VLM)的 2D 理解能力强,却缺少绝对尺度和深度感知,2D 轨迹抬到 3D 后容易悬空或碰撞。前者的问题在于视觉到动作的映射缺乏显式空间表征,场景稍有变化便需重新采集示教数据;后者则根本不知道“1厘米”在三维空间里意味着什么。
在团队先前的探索中,模型已能预测目标物体的 2D 坐标点,但面对“按顺序浇花”、“悬空避障”这类涉及连续时序与三维几何的场景,单个 2D 点根本无法支撑起复杂的物理交互。北航、北大、智源、中科院自动化所等团队的选择是:不让大模型直接猜关节力矩,而让 VLM 把指令拆成一条带物理尺度的多步 3D 轨迹,再交给运动规划器执行。
论文链接:/ai-market-guide/ 他们提出 RoboTracer,以及约 450 万样本、3000 万问答对的 TraceSpatial。轨迹用图像坐标加度量深度(u, v, d)表示,不绑定特定本体,同一套模型可接到 UR5 与 Unitree G1。
AI 科技评论 采访到了 论文核心作者周恩申 。他是北京航空航天大学软件学院博士生,并拥有上海人工智能实验室、银河通用及智源研究院等多家具身智能顶尖机构的研究经历。
作为 RoboBrain 系列项目(从 1.0 到 2.5)的深度参与者,他不仅还原了团队用纯文本 Loss 监督 3D 尺度时的反直觉发现,也客观剖析了纯视觉轨迹在物理力控上的局限,并分享了他对具身智能从“被动感知”迈向“主动感知”的前瞻思考。接下来,本文将从表征表达、绝对尺度注入以及过程奖励机制三个维度,拆解 RoboTracer 如何破局 3D 空间推理。
01 大模型为什么 总在3D空间里“犯路痴”?要让 VLM 从 2D 图像走到 3D 交互,至少要同时做两件事:3D 空间指称(物体在哪、和谁相关),以及 3D 尺度度量(实际有多远、多高)。
二者在模型中彼此耦合。下面我们从三个角度分析:空间点怎么表示、尺度怎么监督、多步推理怎么打分。
空间指称、尺 度度量 与轨迹生成流程示意图 ▎ 忘掉XYZ,用“像素坐标+绝对深度”走捷径 一种直观的思路,是让大模型直接输出物体在相机/世界坐标系下的绝对三维坐标 (x, y, z)。但这条路在实践中极其艰难。
通用 VLM 面对的大量互联网数据天然缺乏 3D 标注,直接预测 XYZ 意味着模型不仅要同时学准三个维度的绝对物理数值,还得在内部硬学复杂的相机内外参,极易导致训练不稳定和几何畸变。 RoboTracer 提出了另一种解法:把关键点拆解为图像坐标 (u, v) 加上绝对度量深度 d。
前两维 (u, v) 是二维图片坐标,与海量互联网 2D 图文数据天然兼容,甚至可以直接复用团队此前在 RoboRefer 中积累的 2D 标注;深度 d 作为一个独立的物理量单独处理。去掉 d 就退回 2D 轨迹,只留起终点就变回 2D/3D 定位,避免了另起一套坐标系带来的数据断层。
这种表征让模型完全绕开了“死记相机物理参数”的包袱。我们采访到的周恩申表示: 一个好的表达方式确实能让通用 VLM 学 3D 事半功倍。
下游只需接入相机内参,就能通过极简的解析投影将 (u, v, d) 无损还原为 3D 物理坐标,消融实验也证实了 UVD 在精度与合理性上均显著优于预测 XYZ。 ▎ 专治“尺度感缺失”,厘米级误差也能纠偏 传统大模型习惯用文本预测数字,用猜 token 的方式逼近厘米级距离,模型往往缺乏真正的空间尺度感。
为了让模型建立对绝对尺度的敏感度,RoboTracer 在架构上引入了两大核心组件: 1.基于回归监督的尺度解码器(SFT) 在网络中引入专门的 标记与轻量级(MLP)解码器,直接将表征映射为真实物理尺度因子。 SFT 阶段不用纯文本分类损失去猜这个数,而是在对数空间做回归。
在建立尺度感的过程中,团队曾踩过一个坑:最开始他们统一将输出单位规范为“米”,效果反而不好。周恩申透露: 大语言模型在预训练阶段已隐式记忆了物体的物理先验(手机是厘米级、桌子是米级),强行统一单位反而会与内在知识打架;放手让模型根据上下文自由选择最匹配的物理单位(米、厘米、英寸等),尺度的估计精度反而显著提升。
即使输入仅为单目彩色图像(RGB),模型也能准确推算出物理尺度因子。 2.通用的空间编码器 RoboTracer 引入了一个基于前馈网络的度量级三维几何先验模型,并采用模块化解耦设计。
它不仅能处理常规的单目 RGB 图像,若现场有深度图或已知内参,也可直接接入这些几何输入,不必为此单独重训。论文中,RGB+内参+深度的 TraceSpatial-Bench 综合成功率从约 39% 升至 45%。
▎ 过程比结果重要,每一步推理都要“打分” SFT 赋予了模型空间感知的“基本功”,但面对“绕过障碍物、悬停特定高度”这类多步约束,模型还需要学会像人类工程师一样做严密的因果推断。传统的强化学习微调多采用 基于结果的奖励(Outcome-based Reward) ,但这在复杂的空间轨迹规划中极易失效:若中间环节发生碰撞或选错参照物,仅凭终点成功与否,模型根本无法得知具体错在哪一步;而若引入另一个大模型充当过程裁判,裁判自身的坐标幻觉反而会带来二次噪声。
RoboTracer 提出了一套 免过程奖励模型(PRM)的规则化过程奖励机制 ,并结合 GRPO(Group Relative Policy Optimization)强化学习算法进行微调。在生成最终轨迹前,模型被强制要求以思维链( ... )的形式,按步骤显式推演中间感知证据。
团队针对多步推理的特性,设计了这样一套规则打分系统:它对度量误差敏感,但对推理步骤的先后顺序不敏感。结构化格式校验(R_PF) :约束模型按 [感知类型] [目标物体]: [数值] 严格输出,例如 [Measuring] [第一朵花高度]: 0.35m、[Referring] [水壶位置]: (454, 723, 0.963)。
分属性度量精度奖励(R_Acc) :针对不同类型的感知步骤设定专属的物理误差容忍阈值(如像素误差在 10% 以内、深度和尺寸估算在 ±30% 以内)。只要推导出的关键感知证据符合真实物理约束,模型就会获得正向激励。
RoboTracer 总体架构与 Step 1-7 多步感知推理示例 这种设计不再强求刻板的线性推理顺序(先识别 A 还是先识别 B 并不影响最终的空间关系判断),而是精准奖励每一个正确的物理感知依据。最后模型给出的不只有轨迹,还有一条可回看的中间证据链。
消融表。 H 为 SFT 完整配置,I 为再加 RFT。
比的是数据配方、空间编码器、尺度监督和 (u,v,d)/ (x,y,z);最右一列是 TraceSpatial-Bench 成功率。 02 450万条轨迹从哪来?
揭秘“数据飞轮”的三条流水线 空间推理能走多远,很大程度上取决于训练数据里有没有尺度、有没有可执行轨迹。在以往的具身智能研究中,空间数据往往陷入两难境地:网上的 2D 图语义丰富,但没有绝对尺度和深度;ScanNet 这类 3D 扫描几何准,却是静态网格,既没有操作轨迹,语言也粗糙。
为了打破这种数据壁垒,团队没有依赖某一种单一数据源,而是构建了一套自动化的数据合成与清洗飞轮,打造了包含 450 万个高质样本、3000 万个问答对 的大规模空间推理数据集 TraceSpatial 。下面我们按三条流水线看。
TraceSpatial 数据总览。左:场景、来源和问题类型;右:2D 网页图、3D 扫描、操作视频三条流水线,分别产出伪 3D 场景图、物体中心轨迹和夹爪中心轨迹。
▎ 流水线一:2D照片“无中生有”,低成本造出伪3D场景 海量互联网 2D 图片能够覆盖丰富多样的室内外场景,为模型提供最基本的空间关系和广博的常识概念;但其局限在于原图只有平面像素,缺乏深度和绝对物理尺度。团队先清洗了约 170 万张开源图,去掉抽象画、低光照、拼贴等难做几何推理的样本,再用单目几何模型 MoGe-2 进行深度估计,同时用 SAM 2.1 (通用图像分割大模型 2.1 版)做实例分割。
空间指称样例:红框为目标,描述里同时给出外观和左右、前后等排序关系。在估算出单张 2D 图的绝对度量深度和内参后,系统将平面图重构为三维点云,并标注出前后、远近、左右等空间方位关系,从而批量生成伪 3D 场景图。
结合大语言模型的层级描述增强,模型在接触复杂动态轨迹前,便已提前建构起对空间相对方位与粗粒度尺度的直觉认知。 ▎ 流水线二:先规划避障路线,再“倒推”出操作指令 相较于 2D 图,3D 扫描数据集(如 ScanNet)拥有精细的人类标注和准确的几何结构,能提供更细粒度的空间方位与物理尺度;但其局限在于它们多为静态室内网格,缺乏动态操作轨迹,模型无法直接从静止点云中理解“拿起、避让、放置”这一连串具有因果关联的物理动作。
为了把静态空间真正用起来,团队没有逐条手标动作,而是在 3D 扫描场景里自动生成轨迹。扫描场景里自动生成的避障轨迹(彩线)及倒写指令。
不同 Method 是不同操作模板;颜色区分被操作物体、终点和参照物。 1.先定动作模板 系统首先构建了一套行为模板,从基础的相对放置、定向推移、垂直堆叠,逐步延伸至高难度的主动绕障放置与绕障堆叠,自动派生出丰富多样的空间操作任务。
2.用 RRT* 找轨迹 有了目标,用 RRT* (渐进最优快速探索随机树算法)在连续 3D 空间里采一条避障路径。由于 3D 扫描网格常存在小范围穿模与噪点,传统 RRT* 极易陷入死锁。
为此,团队引入了视觉开阔度评估与分离轴定理(SAT)机制进行碰撞逃逸,大幅提高了合成轨迹的成功率。这样合成轨迹在仿真和扫描场景里更容易跑通;真机仍受标定、遮挡和深度噪声影响。
3.按轨迹倒写约束 轨迹如果途经某物体边缘,系统就把这层空间关系写成显式指令,例如:“把杯子移到盘子右侧,途中从水瓶上方绕过”。先有路,再写为什么这样走,避障指令就有依据。
▎ 流水线三:从“脏数据”视频里,精准抠出夹爪轨迹 除了物体中心轨迹,末端执行器(夹爪)的运动轨迹同样关键。来自真实机械臂的操作视频是三类数据源中最特殊的一类——它的轨迹最真实、最精确,但文本描述的自由度最低,只能针对视频中实际发生的动作进行精准解构。
团队整合了真实世界的大规模机器人操作视频(如 DROID、AgiBot)以及高精度仿真环境(RoboTwin 2.0)。针对开源真机数据中普遍存在的外参漂移、动作时间段分割粗糙、机械臂自身严重遮挡等“脏数据”痛点,设计了严格的 深度一致性校验算法与基于夹爪开闭状态的动作重分割逻辑 。
真机视频的深度对齐率。绿色可留,红色多半是外参漂了或遮挡严重,进入清洗。
最后同时留下物体中心和末端执行器中心的 3D 轨迹,覆盖单臂、双臂和多种构型。至此,2D 图片的广博语义、3D 扫描的避障规划轨迹、以及真机视频中的精确夹爪轨迹三者交融,扬长避短,为 RoboTracer 构筑起了多层次、大规模的 3D 空间推理数据集 TraceSpatial。
03 实测碾压!同一张“3D路书”竟能 同时指挥机械臂和人形机器人 一套全新的具身方法论是否成立,需要接受两层严苛的检验:一是在标准化基准上与顶尖通用多模态大模型同台竞技,检验其空间推理的精度上限;二是在真实物理世界中直接驱动硬件本体,检验其跨构型复用与抗干扰能力。
RoboTwin 仿真环境演示。模型把长指令拆开,画出 3D 轨迹(蓝色线段),再交给双臂做煎面包、分装汉堡薯条、分层收纳等。
▎ 基准测试:通用VLM集体“翻车”,成功率仅剩3% 在以往的研究中,社区缺乏一个能够专门评估“三维空间多步推理与轨迹生成”的基准。为此,团队构建了包含 100 个真实复杂室内场景的评测基准 TraceSpatial-Bench 。
每个评测样本都需要经历 3 到 8 步的复合度量推理,要求模型不仅要在二维平面指认起始物体,更要在三维空间中生成一条起止精准、且全程与周围环境无碰撞的完整运动轨迹。先看既有基准上的表现。
SFT 之后,RoboTracer 在空间理解、度量、指代等既有榜上平均成功率约 79.1%,比 Gemini-2.5-Pro 高约 11 个百分点。 TraceSpatial-Bench:Overall 为综合三维成功率。
Gemini-2.5-Pro 为 3%,RoboTracer 在 RGB + 过程奖励时为 39%,加上内参和深度为 45%。最大的差距体现在难度极高的自建轨迹榜 TraceSpatial-Bench 上。
该基准要求模型输出起止精准且无碰撞的完整 3D 轨迹:Gemini-2.5-Pro 综合成功率仅为 3%,Qwen3-VL-4B 与 Qwen3-VL-8B 分别为 6% 与 8%。而采用 RGB 输入加过程奖励(2B-RFT)的 RoboTracer 达到了 39%,相较 Gemini-2.5-Pro 提升了 36 个百分点;若进一步接入相机内参和绝对深度,成功率可进一步提升至 45%。
需要说明的是,文中“高出 36 个百分点”特指这一项对比,并非指在所有榜单上都超过通用大模型,也不同于前述 79.1% 的那套基准。消融实验里,度量敏感的过程奖励优于只看结果的奖励;(u, v, d) 也比直接预测 (x, y, z) 更好迁移。
同一指令下各模型的 3D 轨迹。勾叉为是否成功。
通用 VLM 容易悬空或碰障;RoboTracer 及带几何输入的版本更贴场景。 ▎ 真机实战:UR5稳定发挥,G1跨构型复用虽难但行 在实际的机器人控制中,RoboTracer 并没有走端到端预测底层电机力矩的老路,而是将预测出的三维空间轨迹作为 高层空间规划指令 ,下游对接通用的运动规划器与实时感知监测模块。
这种分层做法的好处是:轨迹本身不绑死某一款机器人,换本体时主要改下游规划与控制,而不必重训 RoboTracer。 1.UR5:挪动物体后重规划 以UR5 桌面任务示例:“拿起最右侧的汉堡,避开杂物,放到笔记本键盘前”。
系统以约 1.5 Hz 的频率根据视觉画面重新算轨迹。当人类将汉堡或障碍物挪开时,外部监控系统捕捉到画面变化并触发重规划,系统便重新生成安全的 3D 轨迹。
需要说明的是,这种“重规划”依赖外部监控感知触发,而非原生高频闭环,但已能有效应对低频的动态干扰。 2.G1:同一套轨迹,成功率更低 同一套 (u, v, d) 轨迹可以接到 Unitree G1,做从左到右悬停浇花,不必按 G1 重训 VLM。
论文报告的真机成功率约为:UR5 桌面抓放 60%,G1 浇花 30%;OpenVLA、RoboRefer 的成功率则为 0。跨构型复用成立,但 30% 说明人形长程操作仍是验证,不是稳定可用。
这说明,把带尺度的 3D 轨迹交给规划器,比让通用 VLM 直接在 3D 里「猜动作」更可控。 04 结语: 具身智能不需要“万能黑盒” 在大模型席卷具身智能的当下,学术界和工业界容易走向两种极端:一类寄希望于用海量真机示教数据喂出一个“端到端万能控制器”;另一类则过度相信通用多模态大模型的常识推理,试图直接用 2D 视觉特征指挥 3D 物理实体。
然而,这篇关于 RoboTracer 的研究展现出了一种更为清醒且务实的解题思维: 既不把物理交互当成不可解释的端到端黑盒,也不对纯文本/2D 视觉模型的空间感知抱有不切实际的幻想。通过将具身操作中的长程规划拆解为“3D 空间指称”与“3D 尺度度量”,并以解耦的 (u, v, d) 轨迹作为通往物理动作的几何中介,团队实际上为具身智能的架构设计提供了一条清晰的路径参照: 针对模型对连续数值不敏感的问题,就设计专门的尺度解码器和回归损失来注入度量直觉; 针对多步任务中因果链容易断裂的问题,就用度量敏感的过程奖励来监督每一步的关键依据; 针对静态数据和动态数据之间的断层,就用物理引擎配合防撞规划来自动生成轨迹飞轮。
这种“让大模型专心做高级空间因果推理,把底层动力学与执行交给成熟几何规划”的分层协作范式,不仅让零样本跨构型泛化成为可能,更从根本上降低了真实物理场景下的试错成本与数据门槛。开放场景里的空间智能,仍取决于尺度准不准、中间步骤能不能查。
当然,纯视觉的 3D 空间轨迹依然有其物理局限:它无法承载机械臂在接触物体时的关节力矩与触觉反馈(例如削黄瓜用多大力、夹薯片该多轻)。 RoboTracer 给出的是一条清晰且可复现的工程路径,而不是已经走完的终点。
从 RoboBrain 1.0 到 2.5,大模型在“被动 3D 空间感知”上的能力正被逐步挖掘。但真正的具身智能距离物理世界的常识因果与真实力控还有多远?
下一代具身范式又将走向何方?在ECCV 2026即将召开之际,雷峰网 AI 科技评论与该项研究的核心作者周恩申展开了一场深度对话。
以下为对话摘录,AI 科技评论进行不改变原意的编辑: ▎ AI科技评论:用纯文本监督的方式训练 VLM 做 3D 任务,一开始担心过吗?有没有什么意外的发现?
周恩申 :说实话,一开始我们也不确定能不能做成。大家都知道 VLM 做三维任务并不擅长,只靠 next token prediction 这种纯文本 loss,模型真能学会绝对物理尺度吗?
但最终结果证明,只要数据量足够大、质量足够高,纯靠数据驱动,VLM 完全可以建立起对三维空间与物理尺度的直觉感知。大语言模型在预训练阶段其实已经隐式记忆了大量物体的物理尺度分布,只要表达方式(Representation)和数据机制顺应了这种先验,数据的潜力就能被大幅激发。
▎ AI科技评论:从 3D 视觉轨迹到真实的物理交互,当前最大的“物理断层”在哪里?周恩申 :目前 RoboTracer 预测的 Spatial Trace,本质上是 3D 空间中的一串视觉离散点。
但它反映不出机械臂关节的力反馈,也反映不出夹爪的触觉信号——比如削黄瓜该用多大力、夹薯片该多轻,这些信息仅靠视觉轨迹是无法承载的。如果要真正解决物理接触类任务,轨迹必须从单纯的 Spatial Trace 演变为 Multimodal Trace,在每个节点上附加力控与触觉模态,并形成实时反馈闭环。
另外,高动态响应也是一个现实瓶颈。目前的 VLM 推理速度很难做到高速闭环,面对高自由度、强动态的复杂场景,仅靠视觉重规划还远远不够。
▎ AI科技评论:完成从 RoboBrain 到 RoboTracer 的演进后,您认为具身智能在空间理解上的下一个爆发点是什么?周恩申 : 做完 RoboTracer 之后,我感觉大模型在“被动 3D 空间感知”上的能力,基本已经被探索得差不多了——给一张图片,然后对图片做尽可能多的感知预测,本质上都是一种被动接收。
但人类在现实世界中绝不是这样的。面对一个杂乱场景,我们不会盯着单一角度把像素点分析完才动手,而是会主动与环境交互:挪开遮挡物、调整观察角度、或者走近一点看——通过改变环境来获取更多信息。
我认为下一个真正值得关注的方向是 Active Perception(主动感知) 。模型应该能主动意识到“当前视角信息不足”,并决定转动相机或移动位置去重新观察。
“给定一张图就分析完一切”的假设本身就太强了,真实物理世界不是这样运作的。雷峰网 为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !
进群你会解锁这些「福利」 ?会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ?
进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。搞科研/搞技术,信息差很重要。
来,一起快人一步!上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击 「 阅读原文 」 关注专区。