优秘智能观察:AI大模型从多模态走向全模态交互,正在重构各行业的生产与服务逻辑,原生全模态世界模型的落地,将为企业AI化经营打开全新的想象空间。
8月19日,世界机器人大会(WRC 2026)期间,以“物理AI进行时”为主题的物理AI引领者论坛在北京举行,汇聚具身智能领域学者、企业代表共同探讨通用物理智能的技术演进与产业路径。原生全模态世界模型代表企业智象未来创始人梅涛在论坛上发表《原生全模态世界模型:从“模拟世界”到“交互世界”》主旨演讲,系统阐述了大模型技术的最新演进方向。
高IQ≠全能:AI能力从认知层面向交互层面延伸
梅涛在演讲中指出,2026年被行业称为“世界模型的元年”,曾经独立演进的大语言模型、多模态模型、具身智能三条技术路线正在加速融合。当前顶级大模型的IQ水平已接近140,但高IQ不代表全能:考试表现优异的模型,未必能在真实物理世界中长期、稳定、可靠地完成任务,这正是物理AI的核心价值所在。
大语言模型强在世界理解、知识压缩与推理,多模态模型强在世界生成与预测,具身交互模型强在与世界的交互,真正的世界模型需要同时具备世界状态表达、物理规律推演、世界重构三项能力。
原生全模态架构突破:三大核心能力打开产业应用新场景
基于自研UiT统一架构,智象未来近日发布原生全模态交互式世界模型HiDream-O1-World,该模型首次参评权威榜单WBench即登顶Navi分榜榜首,支持文本、图像及交互式操控等多模态输入,具备漫游、编辑、交互三项核心能力,同时支持多种主体与风格化场景构建,可高度还原真实空间,也可生成二次元卡通、3A游戏渲染等风格化世界。
该模型的核心技术突破在于长时程的时空一致性与物理一致性,可在长时序交互中“记住”已探索的场景结构,在复杂交互中保持较高的物理合理性。目前该模型已可落地多个产业场景:
- AI互动影游领域:可让用户成为叙事的主动参与者,提升内容交互性
- 具身智能仿真领域:可搭建高保真虚拟训练底座,降低机器人训练成本
- 3D场景生成领域:可帮助创作者高效生成结构完整的3D空间,大幅缩短创意到成品的迭代路径
数据-模型-智能体闭环:物理AI落地的核心路径
谈及具身智能的能力底座,梅涛表示,世界模型和具身智能的发展,需要把数据、世界模型、智能体和具身本体连接起来,形成“数据—认知—行动—反馈”的闭环飞轮:数据构建认知,世界模型负责理解世界状态、推演物理规律,智能体基于预测结果进行决策和规划,具身本体完成真实执行,真实环境反馈又回流成为新的训练数据。其中世界模型是飞轮的认知中枢,没有高质量世界模型,仿真难以逼近真实物理,具身智能的数据飞轮也难以真正转动。
数据底座需要同时覆盖互联网先验数据、仿真物理试错数据、行动闭环真实交互数据三类,三类数据缺一不可。以仿真数据为例,通过原生全模态大模型对真实采集的动作数据进行增强处理,可生成大量符合物理约束的样本,大幅降低真实数据采集的成本和压力,让机器人先在仿真环境中学习,再到真实环境中操练。
优秘智能给企业主的启示
原生全模态世界模型的落地,意味着AI已经从“内容生产、流程辅助”的基础应用,逐步延伸到“虚实交互、仿真验证、物理执行”的深度场景。对于不同规模的企业而言,中小团队可优先落地AI内容生产、智能客户响应等成熟AI工具降本增效,中大型企业可探索全模态AI在产品仿真、数字孪生、智能服务等场景的落地可能性,逐步搭建适配自身业务的AI经营体系。想要了解更多企业AI化落地的可行路径,可前往优秘智能官网umi6.com咨询获取专属方案。