会懂网AI资讯获悉,被誉为“AI 教母”的李飞飞团队近日披露一项被称作“里程碑式”的成果:全球首个多模态世界模型。与只会生成文字或图片的模型不同,世界模型试图让 AI 理解物理世界的因果与规律,并可直接用于机器人的预训练,让机器人在进场前就“想明白”该怎么动。
过去机器人学动作,靠的是真机海量试错,又慢又贵。世界模型的价值,是先在虚拟里把世界跑通——物体怎么掉、力怎么传、路径怎么选,模型先推演一遍,再把学到的“常识”迁移到真实机器臂上。这相当于给机器人开了个模拟考,上岗前先刷完题。

多模态是这道题的关键。模型要同时看图像、听指令、读传感器,才能拼出对世界的一致理解。李飞飞一脉长期强调“空间智能”,认为 AI 不能只活在对话框里,得能感知并作用于三维世界。这次成果,正是这条路线往前迈的实质一步。
会懂网注意到,世界模型也是当下大厂争夺的焦点。谁能先让机器人“脑子好使”,谁就离通用具身智能更近。预训练范式从语言搬到物理世界,很可能复刻当年大模型“Scaling 出智能”的剧情,只是这次的主角是动作而非句子。
当然,从论文到产线仍有距离。世界模型的仿真与真实之间必有落差,长程任务里的误差累积也不容小觑。但方向已经清楚:机器人不再逐条写规则,而是先建立一个“内心世界”再去行动。
会懂网判断,这类基础突破的意义,不在于某一篇论文多惊艳,而在于它把“让机器理解物理世界”从口号变成可训练的目标。具身智能的拐点,往往就藏在这样的范式转移里。
会懂网也看到,世界模型的外溢不止机器人。自动驾驶、工业仿真、游戏生成,凡是“需要先理解世界再行动”的场景,都能借这股范式受益。对国内创业公司来说,这反而是个窗口:不必在语言模型红海里硬刚,去物理世界的理解上找缝隙,可能更容易长出自己的壁垒。





























暂无评论内容