生数科技发布通用世界模型五级路线,跑通两级但争议仍在
8月19日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”上,生数科技创始人兼首席科学家朱军抛出一张五级路线图:从能看、能想到能预测、能行动,通用世界模型被拆成五个可衡量的台阶。这不是又一份概念PPT——朱军同时发布了团队的最新研究成果,把其中两个级别真正跑通了。
五级路线图:从感知到行动的五个台阶
朱军在演讲中系统阐述了通用世界模型的五级发展路线。这五个级别并非随意划分,而是对应模型从感知到认知再到行动的递进能力。第一级是基础感知,模型能够理解静态图像或场景,识别物体、空间关系等基本要素。第二级是动态理解,模型开始处理时序信息,理解场景中发生的变化,比如物体移动或事件演变。第三级是预测,模型能够基于当前状态推演未来若干步的可能结果,这是从“看”到“想”的关键跨越。第四级是规划,模型在预测基础上生成行动序列,以达成特定目标。第五级是行动,模型直接输出控制指令,驱动实体或虚拟体执行任务,完成闭环。
这五级路线把模糊的“世界模型”概念拆解成可操作的技术指标。每一级都依赖前一级的能力,但又引入新的技术挑战。例如,从感知到预测需要模型具备因果推理能力,而从规划到行动则要求模型与物理环境实时交互。朱军强调,这并非学术分类游戏,而是为研发和产业落地提供清晰的路线图。
朱军的判断:通用基座模型才是终局
朱军在演讲中明确表示:“从大模型发展的视角来看,我们希望构建的,不只是服务于某个任务或场景的专用模型,而是一个能够理解世界、预测未来并采取行动的通用基座模型。”这句话点出了生数科技的战略定位——不做专用工具,而是押注通用性。
当前AI领域存在两条技术路径:一条是垂直整合,针对自动驾驶、机器人等具体场景训练专用模型,优点是落地快,但泛化能力弱;另一条是通用基座,先构建一个能理解世界底层规律的模型,再适配不同任务。朱军显然站在后者。他认为,专用模型只能解决已知问题,而通用基座模型才能应对开放世界的未知挑战。这种理念与OpenAI的GPT系列、DeepMind的通用智能体研究一脉相承,但生数科技选择从世界模型切入,而非语言或游戏。
通用基座模型的优势在于规模效应——一旦建成,可以低成本迁移到无数场景。但风险也明显:训练难度高、周期长、算力消耗巨大。朱军的判断是,终局属于通用模型,专用模型只是过渡。这一立场在具身智能领域尤为激进,因为机器人对实时性和安全性的要求极高,通用模型能否满足仍是未知数。
跑通的两级:生数科技最新研究成果的含金量
朱军发布的最新研究成果,据称已跑通五级路线中的两个级别。虽然演讲未透露具体细节,但结合生数科技过往的技术积累,可以推测其突破集中在感知和动态理解层面。生数科技此前在视频生成和3D建模领域有深厚积累,其自研的底层模型能够处理高维视觉数据,这为世界模型的感知级提供了天然优势。
跑通两级意味着模型已经能稳定理解静态场景和动态变化,这是迈向预测和行动的基础。但含金量不仅在于技术本身,更在于验证了路线的可行性。朱军团队用实际成果证明,五级路线不是空中楼阁,而是可以逐步实现的。相比之下,许多研究机构仍停留在概念阶段,生数科技至少迈出了实质性两步。
不过,两级到五级之间仍有巨大鸿沟。预测级需要模型具备因果推理能力,这远超当前深度学习范式;行动级则要求模型与物理世界闭环交互,涉及控制论和机器人学。生数科技能否跨越这些门槛,取决于其后续研发投入和技术突破。目前来看,跑通两级是重要里程碑,但距离通用世界模型还有很长的路。
从技术分级到产业落地:具身智能的岔路口
分论坛主题“从技术分级到产业落地”暗示了五级路线的现实指向。具身智能——即能感知、思考并行动的AI系统——是当前AI与机器人结合的热点。生数科技的路线图恰好为具身智能的产业化提供了分级评估框架。
在产业层面,不同级别对应不同应用场景。感知级可用于工业视觉检测,动态理解级可用于视频监控和内容审核,预测级可用于交通流量预测和天气模拟,规划级可用于物流调度和游戏NPC,行动级则直接驱动人形机器人或自动驾驶。生数科技跑通前两级,意味着其技术已具备在视觉相关产业落地的条件,比如智能安防或工业质检。
但产业落地不只是技术问题,还涉及成本、可靠性和标准化。朱军提出的五级路线,实际上为行业提供了一套“能力等级证书”——企业可以根据自身需求选择对应级别的模型,而不是盲目追求全栈能力。这种分级思维有助于降低应用门槛,但也可能让行业陷入“级别竞赛”,忽视实际场景的复杂性。具身智能的岔路口在于:是追求通用大模型,还是针对细分场景做深度优化?生数科技的选择是前者,但市场会给出最终答案。
中国AI团队的世界模型竞速:位置与差距
生数科技的路线图并非孤立事件。全球范围内,OpenAI、DeepMind、Meta等团队都在押注世界模型。OpenAI的Sora展示了视频生成中的世界模拟能力,DeepMind的Genie和Simula则探索交互式环境生成。相比之下,中国团队在语言大模型上已有一席之地,但在世界模型领域仍处于追赶位置。
生数科技的优势在于视觉生成技术积累和工程化能力。其团队来自清华等顶尖高校,朱军本人是ACM/IEEE/AAAI Fellow,学术背景深厚。但差距同样明显:算力资源受制于芯片限制,基础研究起步较晚,且缺乏像OpenAI那样的生态支持。五级路线图是中国团队试图定义规则的一种尝试——通过提出分级标准,抢占话语权。
然而,世界模型的竞争不仅是技术竞赛,更是数据、算力和人才的综合比拼。中国团队在数据规模上有优势,但在高质量数据和先进算力上仍有短板。生数科技能否在五级路线上持续领先,取决于其能否突破这些瓶颈。目前来看,中国AI团队在世界模型领域的位置是“有亮点,但未成势”。
未定之数:五级路线中的争议与空白
五级路线虽然清晰,但存在不少未定之数。首先,各级别之间的跃迁条件是什么?从感知到动态理解,再到预测,每一步需要什么样的模型架构和训练数据?朱军没有给出明确答案。其次,评测标准缺失。如何客观衡量一个模型达到了第几级?目前没有公认的基准测试,这可能导致“自说自话”的评级。
更深层的争议在于,世界模型是否真能通向AGI。批评者认为,世界模型只是对物理世界的模拟,但AGI需要抽象推理、社会认知等能力,这些未必能从视觉预测中涌现。朱军的路线图聚焦于物理世界,但忽略了语言和符号系统,这可能限制了模型的通用性。此外,五级路线隐含了“感知-认知-行动”的线性假设,但真实智能可能是并行或非线性的。
生数科技的研究成果证明了前两级的可行性,但后三级仍是空白。朱军没有透露时间表,也没有给出失败预案。这种不确定性既是挑战也是机遇——如果生数科技能填补这些空白,它将成为世界模型领域的定义者;如果失败,五级路线可能沦为又一个概念框架。目前,这些争议和空白尚无定论,但正是它们构成了世界模型研究的真正前沿。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/gpt/post/20260825/%E7%94%9F%E6%95%B0%E7%A7%91%E6%8A%80%E5%8F%91%E5%B8%83%E9%80%9A%E7%94%A8%E4%B8%96%E7%95%8C%E6%A8%A1%E5%9E%8B%E4%BA%94%E7%BA%A7%E8%B7%AF%E7%BA%BF%E8%B7%91%E9%80%9A%E4%B8%A4%E7%BA%A7%E4%BD%86%E4%BA%89%E8%AE%AE%E4%BB%8D%E5%9C%A8/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com