VicroCode
让代码创造价值
VicroCode是一个轻量级代码在线发布、交易平台,开箱即用,免部署、免服务器、免备案,支持接入智能体、通用管理系统、游戏等多种项目
稍候片刻,您可先学习AI编程手册
正在加载中...

市场信息

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied 量子位的朋友们 2026-09-07 14:03:34 来源: 量子位 今日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。秉承原生全模态的技术理念,模型强化机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。

www.qbitai.com · 2026-09-07T06:03:34+00:00

原生全模态技术战略闭环,智象(HiDream.ai)发布具身世界模型HiDream-O1-Embodied 量子位的朋友们 2026-09-07 14:03:34 来源: 量子位 今日,智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied。秉承原生全模态的技术理念,模型强化机器人物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。

具身模型的发布,标志着智象逐步实现了打通图像、视频、3D、动作等模态,贯通理解—推演—执行全流程,构建统一世界模型基座的技术闭环。模型发布同期,HiDream-O1-Embodied首次参评具身智能模型评测平台RoboColiseum,即在核心的Robustness(扰动适应)子榜单中,以平均分0.692的成绩登顶榜首。

智象未来CTO姚霆表示:“我们相信,围绕真实世界的表达、理解和生成,构建同时具备全模态表达、因果推演与物理世界构建三大核心能力,才能建立完整的世界模型基座。智象的原生全模态世界模型技术理念,从设计架构之初便计划面向包括动作等全模态在内的统一表征构建。

HiDream-O1-Embodied的发布,是这一技术战略从 “模拟世界” 迈向 “真实世界” 的关键里程碑。登顶RoboColiseum:用0.692分的“扰动适应”交出硬核答卷 常态化具身智能仿真评测平台RoboColiseum旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。

平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。该平台基于高保真仿真环境构建,高度还原真实世界。

平台围绕四个维度推出4类能力子榜、78个高保真仿真评测任务——指令跟随、空间理解、扰动适应与通用操作。自内测上线以来,已吸引海内外几十款重量级模型开展评测。

在这四个维度中,扰动适应(Robustness)被公认为最具挑战性的一环 。它通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。

换言之,这不是在实验室的“温室”里考试,而是在各种“意外”中检验真本事。 HiDream-O1-Embodied以0.692分的成绩登顶该榜单榜首,这得益于其原生全模态底座。

原生全模态世界模型天然为跨模态的理解与生成提供了基础。而在执行环节,为了保证在真实世界的各类 “意外” 中保持稳定。

HiDream-O1-Embodied 在三项核心能力上进行了突破性创新,让理解更精准、感知更稳健、抗干扰能力更强。语言理解——突破关键词匹配的局限 传统机器人对语言指令的理解往往停留在关键词匹配层面。

说“把杯子拿过来”能听懂,换成“给我拿个杯子”或“杯子递我一下”就可能“宕机”。 HiDream-O1-Embodied覆盖多元动词、句式与表达方式的等价指令空间,不被句式束缚,只锁定意图本身。

无论指令如何变换,它都能穿透字面,直达用户的本意。视觉感知——多视角协同,避免“一处失灵、全局失效” 在物理世界中,机器人的视觉通道并非是理想状态。

相机位置可能发生偏移,标定精度会随时间变化,单路画面也可能受到遮挡或干扰。 HiDream-O1-Embodied综合多个视角的信息,让不同视觉通道相互补充,而非依赖某一固定视角。

当部分视觉信息出现偏差或暂时不可用时,模型仍能借助其他视角理解场景、判断任务并继续执行,让系统从“一处失灵、全局失效”,转变为“局部受限、整体仍可运行”。高容错机制——在“不完美”中学会稳定执行 多数模型的训练基于“完美数据”——清晰的图像、完整的画面、标准的视角。

但真实世界从来不是这样。光照变化、画面污损、视野遮挡、信号波动,都是机器人实际运行时可能遇到的日常情况。

HiDream-O1-Embodied在训练阶段便主动引入多种非理想条件,让模型反复面对不完整、不稳定的信息,并学会从有限线索中作出可靠判断。这样的训练使模型不只追求理想条件下的最佳表现,也更加重视复杂环境中的持续稳定。

这种容错能力也不局限于某一种视觉异常。面对光照、外观和场景变化,模型能够更灵活地利用已有信息,减少环境变化对任务执行的影响。

对HiDream-O1-Embodied而言,真正重要的不只是“看得清时做得好”,更是“条件不理想时,依然能够稳稳完成任务”。模型 + 数据:打造“真实基座 + 生成增强” 数据生产范式 而这种“在训练中见过足够多不完美”的能力,并非凭空而来。

它触及一个更底层的命题:模型的认知边界,由它所接触的数据所影响。高质量数据,恰恰是具身训练中最稀缺、也最具决定性的变量。

智象极力打造的“模型+数据”双驱动的策略,正是问鼎具身世界模型榜单的真正护城河。该策略的关键突破口,在于让数据生产本身成为模型迭代的有机一环。

为此,智象探索出“真实基座 + 生成增强”的数据生产范式。模型不再是被动接收数据,而是主动参与数据的创造。

以与诺亦腾的合作为例:其高精度真人动作捕捉数据作为真实底座,智象借助原生全模态能力完成百倍级的数据精细化扩增。基于单段真实动作样本,模型可以生成变体视频:在严格恪守物理约束不变的前提下,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。

这一机制的关键,在于模型既做“考生”,也做“出题人”——它根据自身所需主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮。最终让 HiDream-O1-Embodied 在面对现实世界的强扰动时,展现出超乎寻常的鲁棒性。

原生全模态世界模型矩阵日臻完善 就在不到一个月前,智象刚刚发布了交互式世界模型HiDream-O1-World,并在交互式视频世界模型评测基准WBench的Navi分榜中以平均分80.9登顶榜首。交互式世界模型解决的是“理解与推演”,让AI在数字世界中具备对空间、时间、运动与物体关系的完整认知。

而具身世界模型解决的是“操作与执行”,让AI在物理世界中完成真实任务。两者将形成有力互补,为原生全模态世界模型的发展筑牢根基。

正如智象未来创始人兼CEO梅涛博士此前所言, 下一代大模型竞争的关键,不在于单一模态能力的增长,而是从单模态走向多模态,并走向原生统一的全模态。从HiDream-O1-Image到HiDream-O1-World,再到HiDream-O1-Embodied,智象作为创新型大模型企业,正坚定地逐步形成覆盖视觉模型、交互式世界模型及具身世界模型的模型家族矩阵。

这既是原生全模态技术在多领域铺展的能力,更体现了其强大的内生进化能力。站在世界模型前沿技术加速发展的时代拐点,智象正加速创新向前。

本文由智象未来提供,量子位获授权转载,观点归原作者所有。版权所有,未经授权不得以任何形式转载及使用,违者必究。

返回 AI 市场导读

来源:qbitai.com