原生全模态世界模型:AI从模拟走向交互的路径
8月19日,世界机器人大会(WRC 2026)上,智象未来创始人梅涛提出一个反直觉观点:高IQ不等于全能,AI正从“理解世界”走向“改变世界”。他给出的路径是原生全模态世界模型——不是把文本、图像、视频简单拼接,而是让AI在统一框架中模拟物理规律,进而与真实世界交互。这一技术转向,正在重新定义机器人和自动驾驶的底层能力。
从多模态到原生全模态:AI学习范式的根本转变
梅涛在演讲中系统阐述了大模型从多模态走向原生全模态的技术演进逻辑。传统多模态模型将文本、图像、视频等数据分别处理,再通过后期融合实现跨模态理解。这种拼接式架构存在天然缺陷:不同模态的表征空间不一致,导致模型难以捕捉模态间的深层关联。例如,一个多模态模型可能识别出“苹果”的图像和“苹果”的文本,但无法理解“苹果从树上掉落”这一物理过程的动态因果。
原生全模态则从底层统一表征空间,让所有模态共享同一套参数和训练目标。梅涛强调,这种设计让模型能够学习跨模态的共性规律,而非孤立地处理每种数据。在物理AI场景中,机器人需要同时处理视觉、触觉、力觉和运动指令,原生全模态的架构使得这些信号能在同一框架内协同推理,而非各自为政。这种范式转变,本质上是将AI的学习目标从“识别模式”转向“理解规律”。
模拟世界:世界模型如何构建物理规律的数字孪生
世界模型的核心能力在于模拟。梅涛指出,原生全模态世界模型能够基于当前状态预测未来帧,从而在内部构建一个物理世界的数字孪生。这种模拟不是简单的视频外推,而是通过学习物理规则——如重力、惯性、碰撞——来生成符合因果的后续状态。例如,给定一个杯子在桌沿的视觉输入,模型能预测它接下来会掉落并碎裂,而不是凭空消失。
这种模拟能力依赖于大规模多模态数据的训练。模型需要同时观察视觉变化、听到声音反馈、感知触觉信号,才能建立完整的物理直觉。梅涛在演讲中强调,模拟阶段是交互的基础,因为只有准确预测世界如何响应,AI才能规划有效的行动。当前,这类模型已在仿真环境中展现出潜力,但真实世界的复杂性和噪声仍是挑战。
交互世界:从被动感知到主动干预的跨越
梅涛的核心观点是,高IQ不等于全能。传统AI追求高智商,在语言、图像识别等任务上超越人类,但这些能力仅限于“理解”层面。要“改变世界”,AI必须能够主动干预物理过程,而这需要世界模型从模拟走向交互。交互意味着模型不仅要预测,还要决策——选择哪些动作能产生期望的结果。
这种跨越要求模型具备闭环学习能力:从行动中获取反馈,更新对世界的认知。梅涛指出,原生全模态世界模型通过统一表征,使得交互过程中的多模态反馈(如视觉变化、触觉阻力)能直接用于调整策略,无需额外的转换层。这缩短了感知-决策-执行的回路,让AI从被动观察者变为主动参与者。在机器人领域,这意味着机械臂不仅能识别物体,还能根据实时反馈调整抓取力度和角度。
Physical AI落地:机器人、自动驾驶与具身智能的新引擎
论坛主题“物理AI进行时”点明了这一技术的产业指向。梅涛的演讲为Physical AI的底层能力建设提供了新视角。在机器人领域,原生全模态世界模型赋予机器人类人的物理直觉,使其能在未知环境中灵活操作。例如,家庭服务机器人需要理解“杯子易碎”这一隐含属性,从而调整抓取策略,这依赖于模型对物理规律的模拟。
自动驾驶同样受益。车辆需要预测行人、其他车辆的动态,世界模型能基于多模态传感器数据构建周围环境的实时模拟,提前规划安全路径。梅涛强调,这种模型比传统感知-规划分离的架构更高效,因为它将预测和决策统一在同一框架内。WRC 2026上,具身智能成为焦点,而原生全模态世界模型被视为连接数字智能与物理世界的桥梁。
挑战与争议:数据、算力与可解释性的三重门
尽管前景广阔,原生全模态世界模型面临严峻挑战。首先是数据需求。训练一个能模拟物理规律的世界模型,需要海量多模态交互数据,而真实世界的标注成本极高。梅涛在演讲中未回避这一问题,指出当前数据获取是瓶颈。其次是算力。统一表征意味着更大的模型规模和更复杂的训练过程,计算成本可能远超现有大模型。
可解释性同样棘手。世界模型内部如何表征物理规律,目前仍是一个黑箱。在安全攸关的领域如自动驾驶,这种不可解释性可能阻碍监管批准。梅涛提到,行业正在探索因果推理和模块化设计来提升透明度,但尚无定论。这些挑战意味着,从模拟到交互的跨越不会一蹴而就,需要算法、硬件和数据的协同突破。
产业竞速:从WRC 2026看物理AI的生态布局
WRC 2026不仅是技术展示的舞台,更是产业布局的信号。由跨维智能主办、《财经》杂志协办的论坛,汇聚了具身智能领域的顶尖学者和企业创始人,而“中国AI 100榜单”的启动,标志着物理AI进入资本和市场的视野。智象未来作为原生全模态世界模型的代表企业,其技术路线被置于聚光灯下。
梅涛的演讲并非孤例,而是反映了行业对通用物理智能的追求。从机器人到自动驾驶,各家企业都在探索如何让AI真正“动手”。然而,技术路线尚未收敛,原生全模态只是其中一种选择。产业竞速的关键在于谁能率先解决数据、算力和可解释性问题,并找到商业化落地的场景。WRC 2026上的讨论表明,物理AI的生态正在形成,但格局远未定型。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/geek/post/20260824/%E5%8E%9F%E7%94%9F%E5%85%A8%E6%A8%A1%E6%80%81%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8BAI%E4%BB%8E%E6%A8%A1%E6%8B%9F%E8%B5%B0%E5%90%91%E4%BA%A4%E4%BA%92%E7%9A%84%E8%B7%AF%E5%BE%84/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com