VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

7 篇 ECCV 论文!极佳视界联合顶尖高校,打通空间智能从「看得稳」到「摸得准」再到「决策灵」的落地瓶颈

以推理决策与物理重建,让空间智能从生成走向因果交互。 作者丨 张 璐 编辑丨 幸丽娟 在生成式 AI 的演进历程中,从二维像素走向三维物理世界,是人工智能迈向现实落地的必经之路。 以 3D Gaussian Splatting、Sora 级视频生成以及多模态大模型为代表的技术,曾让行业看到了空间智能的巨大潜力。

www.leiphone.com · 2026-09-09T02:30:00+00:00

以推理决策与物理重建,让空间智能从生成走向因果交互。作者丨 张 璐 编辑丨 幸丽娟 在生成式 AI 的演进历程中,从二维像素走向三维物理世界,是人工智能迈向现实落地的必经之路。

以 3D Gaussian Splatting、Sora 级视频生成以及多模态大模型为代表的技术,曾让行业看到了空间智能的巨大潜力。然而,当这些原本运行在数字世界中的算法尝试走向真实硬件与物理场景时,整个行业正在遭遇一场前所未有的“落地阵痛”。

当前的视觉与空间模型看似绚丽,却普遍陷入了三重难以逾越的瓶颈:决策依赖暗盒式的直接预测,缺乏对物理因果的常识推理;三维资产仅停留于视觉逼真,剥离了质量与形变等物理属性;世界模型缺乏对动作控制的精确响应,沦为无法评估安全的离线画面。缺乏逻辑推理、缺乏真实物理属性、缺乏控制闭环,这三大软肋直接阻断了物理 AI从实验室 Demo 迈向工业落地的可能。

突破这些瓶颈的关键,不再是单一模型参数的堆叠,而是要建立一套贯穿“空间感知、物理推演到具身决策”的技术演进图谱。在本届计算机视觉顶级学术会议 ECCV 上,极佳视界(GigaAI)展现出了极其瞩目的学术爆发力,共有 13 篇论文成功入选。

其中,有 7篇落在了空间智能这个研究方向。极佳视界联合清华大学、中国科学院自动化研究所、浙江大学、上海交通大学等顶尖学术机构,将这 7 项重磅研究汇聚成了一套完整的技术破局方案。

不同于零散的学术试验,这一系列成果展示出了一条极其清晰的技术演进路径:物理 AI 的终局,不仅是生成逼真的画面,而是打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的具身大脑。 01 打破暗盒与离线, 重构具身大脑与试车场 在传统的具身智能与自动驾驶开发中,模型大多扮演着一个“暗盒”角色:输入传感器图像与自然语言指令,通过端到端神经网络直接预测并输出末端执行器的动作坐标或车辆轨迹。

这种“图像进,动作出”的暗盒模仿范式,在环境简单、分布内的数据集上或许能跑出不错的成功率。然而,一旦面对真实世界中复杂的物体遮挡、未见过的物品样式、随机的动态扰动以及长程多步骤任务时,暗盒模型就会暴露出致命的缺陷:它无法解释自己“为什么这么做”,也无法在遇到偏差时进行自我修正。

极佳视界的破局思路很明确:把“思维链推理”与“强化学习”深度融入决策闭环。无论是微观的桌面操控,还是宏观的道路驾驶,都打造出了可落地的技术标杆。

▎ 从暗盒操控到显式推理:VLA-R1 将 R1 强化学习引入具身决策 论文:VLA-R1:Enhancing Reasoning in Vision-Language-Action Models 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接:/ai-market-guide/ 传统的具身操控大多依赖暗盒式的模仿学习,试图直接从像素跳跃到末端执行器的控制坐标。这种跳过逻辑推导的直觉反应,在面对遮挡、复杂常识与多目标干扰时极易失效。

要打破这种局限,关键在于赋予模型像人类一样“先推理、后动手”的能力。极佳视界联合中科院自动化所、清华大学打造的 VLA-R1 框架,首次将类似 DeepSeek-R1 的强化学习(RL)与显式思维链(CoT)深度融入具身操控中。

VLA-R1 整体训练框架:结合 SFT 显式思维链推理与 GRPO 强化学习的多维可验证奖励对齐 VLA-R1 改变了传统模型直接输出动作坐标的做法,强制要求模型在输出控制指令前,先生成一段可解释的文本思维链。机械臂必须像人类一样,显式推导并回答“当前物体的空间遮挡关系如何”、“哪一个是目标容器”、“如何规划无碰撞路径”等物理常识问题,并同步预测出物理可供性区域与 3D 运动轨迹。

为了支撑这一高质量的逻辑推导,团队专门构建了包含 1.3 万条精细化标注的 VLA-CoT 数据引擎,为模型注入丰富的物理常识与空间因果关系。同时,在强化学习训练阶段,VLA-R1 摒弃了传统人工打分或模糊的倾向性奖励,而是从空间对齐、轨迹一致性与输出格式规整度三个维度设计了可精确计算的硬约束奖励机制(GRPO),大幅提升了模型在复杂场景下的决策稳健度。

在实验评估中,引入 GRPO 强化学习后,VLA-R1 的可供性区域 IoU 指标飙升至 36.51 ,轨迹平均误差大幅降至 91.74 。复杂任务实例:把面包放进微波炉 在真实餐桌场景的复杂真机测试中,面对物体的临时移动与随机遮挡,配备 VLA-R1 的机械臂表现出了极强的鲁棒性与确定性,将具身操控从“碰运气式模仿”带入了“可解释、可验证决策”的新阶段。

▎ 从视频播放到闭环评估:OmniNWM 打造可响应、能打分的驾驶世界模型 论文:OmniNWM: Omniscient Driving Navigation World Models 合作机构:上海交通大学 × 清华大学 × 鉴智机器人 × 东方理工大学(联合新加坡国立大学、武汉大学等) 论文链接:/ai-market-guide/ 如果说 VLA-R1 攻克的是微观物理空间下的具身决策,那么在宏观自动驾驶领域,物理 AI 则需要一个具备全局视角与动作响应能力的世界模型作为“数字试车场”。在自动驾驶与宏观导航场景中,过去的世界模型大多停留在“生成逼真视频”的离线展示阶段,既无法响应连续的动作控制,也缺乏安全评估机制。

极佳视界联合上海交大、清华等机构推出的 OmniNWM ,则在单一生成框架下实现了状态、动作与奖励打分的三者统一。 OmniNWM 核心架构图 在状态表征上,OmniNWM 打破了单一 RGB 摄像头的视觉局限,能同步生成全景 RGB 视频、语义分割图、度量深度图以及 3D Occupancy(占据网格),确保生成的虚拟环境具备高度一致的空间物理表征。

在动作控制层,它利用归一化的全景 Plücker 射线图将车辆轨迹编码为像素级控制信号,彻底解耦了对特定相机外参的依赖,使得生成的视频与 3D 空间能够极其精准地响应任意车辆规划的转向、加速与换道轨迹。更具颠覆性的是其评估机制,OmniNWM 抛弃了外接评估模型的传统做法,直接利用内生生成的 3D Occupancy 占据网格,构建了一套面向碰撞安全与交通规则遵循的稠密奖励函数。

这使得模型在合成未来预测场景的同时,就能自动为当前车辆的驾驶策略进行精准打分。 3D 语义占用场景演示 实验表明,OmniNWM 在视频生成质量、长时距生成稳定性以及控制响应精度上均达到了行业领先水平。

它将驾驶世界模型从单纯的“画图工具”,正式推进至能够直接服务于自动驾驶端到端策略训练与安全测试的数字试车场基础设施。 02 告别“纸片模型”,赋予 3D 资产 真实物理触感与 4D 动态推演 解决了大脑的逻辑推理与闭环评估后,物理 AI 面对的下一个核心考题,是“环境与资产”的真实性。

如果仿真世界里的物体只是视觉逼真,机器人一旦与之发生力学交互或跨时空演进,系统就会因为缺乏真实物理响应而失去意义。极佳视界的破局点,在于将“视觉表征”与“物理系统”深度结合,并打通了从静态 3D 到动态 4D 的连续推演通道。

▎ 从离线优化到秒级重构:ReconPhys 赋能 3D 资产真实物理属性 论文:ReconPhys:Reconstruct Appearance and Physical Attributes from Single Video 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接: /ai-market-guide/ 传统方法在赋予 3D 资产形变与力学参数时,通常依赖极其昂贵的人工标注与离线计算,需要针对具体场景优化数小时,极难规模化应用。极佳视界联合中科院自动化所、清华大学发起的 ReconPhys 研究,打破了外观重建与物理估计割裂的范式。

它创新性地将 3DGS的视觉表示与可微弹簧-质点物理系统深度绑定,让高斯粒子在具备几何外观的同时,天然绑定了刚度、质量与阻尼等物理属性。为了摆脱对人工物理标注的依赖,团队利用可微渲染与可微物理系统的协同,构建了纯视觉引导下的自监督优化链路,仅凭渲染像素级的监督即可反向推导出物体的真实物理特性。

更具实用价值的是,ReconPhys 将繁重的物理反算过程消化在训练阶段。在实际推理时,模型无需再进行离线迭代,仅需输入一段普通的单目视频, 不到 1 秒 即可直接前馈式输出一套绑定了完整物理属性的 3DGS 资产。

这种秒级物理重构的能力,为机器人柔性操控、物理图形仿真以及大规模 Real-to-Sim 数据生成提供了低门槛的高效入口。 ▎ 从静态定格到几何感知:MoGe4D 驱动单图推演 4D 动态世界 论文:Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation 合作机构:极佳视界× 清华大学 论文链接: /ai-market-guide/ 静态空间的表达已被逐渐攻克,但真实世界本质上是随时间连续演进的。

以往的方法常常将 3D 重建与动态运动生成剥离,导致 4D 画面在视角变动或动态生成时频频出现结构崩塌。极佳视界与清华大学提出的 MoGe4D ,尝试将两者在统一框架下深度打通。

它先从单张图片估计出初始的三维几何结构,再以此几何为强约束条件,利用专门的 4D-STraG 模块预测空间各点相对于首帧的动态轨迹,最后由 4D-ViSM 模块完成任意视角下的动态渲染。此外,团队还专门构建了包含 6 万组带稠密 4D 点轨迹的真实视频数据集 TrajScene-60K,为运动生成提供了坚实的数据支撑。

在渲染质量、视角一致性与时空稳定性上,MoGe4D 大幅超越了现有的主流生成范式,单张显卡约 6 分钟即可稳定推演出高质量的 4D 视频,为沉浸式影视、空间内容生产与数字孪生提供了更统一的技术工具。传统 4D 生成范式(a、b)与 MoGe4D 几何感知生成范式(c)的技术路线对比 03 筑牢工业级 3D 高精几何底座 与工程落地管线 具身大脑决定了如何决策,真实物理赋予了触感与环境响应,而最底层的三维几何重建,则是支撑起整个物理 AI 世界的技术地基。

在过去的 3D 感知与重建管线中,行业普遍面临着两难境地:要么为了追求几何一致性而陷入极其昂贵的算力开销;要么为了追求生成速度,导致重建出的 3D 资产充斥着杂点、重影与边缘模糊。极佳视界通过一系列从算法范式到工程架构的创新,把 3D 感知与重建推向了“工业级可用”的高标准。

▎ 从 2D 匹配到 3D 对齐:VolSplat 构建稳定可信的三维体素几何 论文:VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction 合作机构:极佳视界 × 浙江大学× 香港中文大学 × 清华大学×南洋理工大学 × 阿德莱德大学 × 莫纳什大学 论文链接: /ai-market-guide/ 现有的前馈式 3DGS 重建方法,大多依赖 2D 像素特征强行推算 3D 结构,在面对多视角或弱纹理场景时极易产生杂点与几何扭曲。极佳视界联合浙大、清华等多所全球顶尖高校推出的 VolSplat ,直接抛弃了传统的 2D 盲目匹配范式。

它将多视角图像特征反投影到统一的 3D 体素网格中进行空间融合,再由 3D 解码器在体素空间直接预测高斯参数。传统像素对齐范式(左)与 VolSplat 体素对齐范式(右)的前馈 3DGS 重建流程对比 这种从2D 匹配转向3D 对齐的建模方式,不仅让多视角对齐自然地发生在三维空间中,还能根据场景复杂度按需调整高斯密度,显著提升了几何一致性与可信度。

这为前馈式 3DGS 提供了一条更符合空间结构本质的技术路线,也推动了 3D 内容生产从快速生成迈向稳定生成、可信生成。 ▎ 工业级工程优化:AnchorSplat 与 2K Retrofit 解锁高清与低功耗 在建立了稳定的体素几何框架之后,极佳视界还针对工业生产管线中的“渲染细节”与“算力吞吐”两大落地瓶颈,给出了极具实用价值的工程解决方案: 从反向优化到点锚机制:AnchorSplat 0.01 秒重塑高频细节 论文:AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting 合作机构:极佳视界 × 中国科学院自动化研究所 × 上海科技大学 × 清华大学 论文链接:/ai-market-guide/ 现实中许多通过 AI 生成或扫描的粗糙 3D 资产普遍存在偏糊、偏稀的问题,而传统耗时数分钟的反向优化极难适应工业流水线。

极佳视界与中科院自动化所、上科大推出的 AnchorSplat ,打造了一个完全运行在 3D 空间内的即时资产增强网络。它通过“点锚机制”约束新高斯粒子的局部生长,以单次倍增替代传统的迭代密化,在 0.01 秒 内即可重塑高频细节,为大规模 3D 内容生产与资产修复补齐了关键一环。

从全图计算到稀疏精修:2K Retrofit 低功耗解锁生产级高清 论文:2K Retrofit:Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction 合作机构:极佳视界 × 北京航空航天大学 × 国防科技大学(联合 OpenHelix Robotics 等) 论文链接:/ai-market-guide/ 针对自动驾驶全景感知等大场景高清预测中的算力爆炸难题,极佳视界联合北航、国防科技大学等机构发起的 2K Retrofit ,洞察到几何预测残差 90% 以上都集中在边缘与遮挡交界处。模型无需修改或重训原始 Backbone,而是利用冻结的基础模型生成稳定的全局粗几何,再利用熵信息精准定位少量关键区域进行稀疏精修。

这种“全局稳态 + 稀疏精修”的思路,以极低的算力开销将现有的几何基础模型直接推进至 2K 分辨率的生产级应用场景。 04 结语:从视觉生成 迈向物理世界的闭环演进 纵观极佳视界在 ECCV 上展现的学术成果,13 篇入选论文展现了其深厚的学术积淀,而其中直指“空间智能与物理 AI”的 7 项重磅成果,则勾勒出了一条极其严密的技术演进主线: 以 VolSplat、AnchorSplat 与 2K Retrofit 打牢工业级 3D 几何底座;以 ReconPhys 与 MoGe4D 赋予空间 4D 动态推演与真实物理触感;最终通过 VLA-R1 与 OmniNWM 在具身操控与驾驶场景中打通“逻辑思考、动作执行与闭环评估”的完整决策链路。

空间智能与 Physical AI 的终局,绝不仅仅是生成一段漂亮的视觉 Demo 或重建一个精致的静态模型,而是要打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的数字与物理实体。物理 AI 的竞争,正在从单纯的“画质比拼”与“离线生成”,全面转向“物理可信、逻辑可推理、控制可闭环”的深水区。

极佳视界通过这一系列全栈技术的集中布局,不仅攻克了具身智能落地的关键瓶颈,更在通往下一代通用物理世界 AI 的征程上,铺设了切实可行且具备示范效应的技术基石。雷峰网 为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群 !

进群你会解锁这些「福利」 ?会议情报站 : 投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会 : 天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。前沿补给站 : 最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团: (会议期间专属开启): 到了会场也不用慌—— 路线导航 : 场馆分布、报告厅怎么走,群里随时问; 议题共读 : 热门 session、Keynote 现场探讨,错过也能追; Poster 汇编 : 现场海报精华整理,一键收藏不遗漏; 约局广场 : 约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。 ?

进群传送门: 扫码进群或添加微信 Qvv0909777 ,备注:ECCV + 单位/学校+姓名+方向 。搞科研/搞技术,信息差很重要。

来,一起快人一步!上车,带你看遍全球 AI 顶会精华 可独家畅览: 专家演讲PPT 大会报告全文 热门论文解读 学术新星访谈 扫描上方二维码 或点击 「 阅读原文 」 关注专区。

返回 AI 市场导读

来源:leiphone.com