新浪科技

大模型快要摸到天花板了,现在是李飞飞的时间

起点财经

关注

22年前,刘慈欣在《镜子》里写过一个令人脊背发凉的设定:

人类用超弦计算机复现整个宇宙,造出一面能看清任何时间、任何地点发生过什么的镜子。最终,绝对透明的文明失去活力,人类在澄澈中枯萎。

2026年9月2日,这个故事的第一章,被“AI教母”李飞飞做出来了一部分。

她创办的World Labs发布“全球首个多模态世界模型”Atlas:

给出几张照片,它能重建3D世界;画一条轨迹,它能生成像素级运镜的一分钟1440p视频。李飞飞称之为“里程碑式”成果,英伟达机器人主管Jim Fan评价,这是机器人领域Real-to-Sim(真实到仿真)的“一大步”。

北京时间9月2日,AI教母李飞飞和她的World Labs,把这个故事的第一章,做出来了一部分。正式发布“全球首个多模态世界模型” ——Atlas,它能以像素级相机控制生成图像与视频,并将画面重建为3D世界。李飞飞本人将其称为“里程碑式”成果并在社交平台置顶,表示Atlas“为从视觉特效到机器人的众多应用场景打开了大门”。

一面“镜子”,到底值多少钱?

先看Atlas能做什么。

输入1至6张参考图,画好想要的运镜轨迹,它生成最长60秒、1440p的高清视频;给它几张到几十张照片,它重建出完整的3D空间,输出游戏和VR行业直接可用的点云和3D高斯泼溅格式;它还能从手机随手拍的视频里同时读懂时间与空间,实现《黑客帝国》式的“子弹时间”。

Atlas核心参数

这些能力的商业本质,是把“理解并复现三维世界”的成本打到接近于零。

1999年拍“子弹时间”,需要几十台专业相机围成一圈;现在,一部手机拍几段素材就能实现。官方演示里,凭2至25张地面拍摄的照片,Atlas重建了整个金门大桥的周遭,甚至生成了拍摄者自己都没见过的高空俯瞰画面。

 镜头路径。现在靠Atlas,这一步则省下不少导演的脑细胞,它把相机轨迹本身变成了输入,省下原本描述“轨迹”的那部分编写提示词的时间。

影视特效、游戏场景、室内设计、机器人仿真,这些行业过去最贵的成本项,是“搭建一个可信的世界”。

Atlas干的正是把这件事从专业团队的重资产工程,变成一句提示词加几张照片的轻资产操作。成本结构一旦被重写,整个内容产业的价值链就要重新分配。

更关键的是技术路径的分野。

以往的多模态模型,本质是把图像视频“翻译”成文字再处理,模型并不真正懂得物体在三维空间中的位置。Atlas把每一帧画面都绑定到三维空间的精确坐标上,构成“空间上下文”,再在此基础上生成。

打个比方:

传统模型是在一段文字后续写下一个词,Atlas是在一张带坐标轴和比例尺的三维草稿里续写下一部分。

这就是“世界模型”和“视频模型”的区别,也是它敢称“全球首个”的底气。

两年估值涨25倍,资本在买什么?

资本市场对这条路径的投票干脆利落。

2024年4月,World Labs成立当月即获a16z和Radical Ventures投资,尚无产品,估值约2亿美元;同年9月官宣累计2.3亿美元融资,估值超10亿美元,跻身独角兽;2026年2月,再获10亿美元新融资,估值冲到50亿美元,累计融资约12.3亿美元。

World Labs估值与融资

投资人名单堪称豪华:

机构里有英伟达、AMD、Autodesk、富达、淡马锡;个人里有AI教父辛顿、谷歌首席科学家迪恩、AMD的苏姿丰、图灵奖得主杨立昆。

这些人没有一个以轻信著称。

他们买的不是“AI教母”的光环,而是一个判断:

大语言模型这条路,快要摸到天花板了。

这个判断由李飞飞本人在2025年11月的长文《从文字到世界》中系统阐述:

语言在人类演化史上只有约50万年,是极其晚近的产物;而视觉、触觉代表的感知能力,早在5亿年前的寒武纪就开始演化,时长约为语言的1000倍。

只会语言的AI,如同“黑暗中的文字匠”,辞藻华丽却脱离现实,将被永远困在数字世界里。

当LLM的scaling law红利日渐稀薄,资本需要下一条曲线。

空间智能和世界模型,就是李飞飞给出的答案。

黄仁勋、哈萨比斯的公开支持,辛顿和迪恩的私人支票,都是对这条曲线的提前定价。两年25倍的估值增长,买的不是现在的Atlas,而是“AI从看懂文字到看懂世界”的范式转移。

护城河有多深,泡沫就有多近

World Labs的护城河,在于它用两年搭出了一条完整闭环:

2025年11月推出首个商业产品Marble,让普通人用几张照片生成可编辑的3D世界;

2026年6月发表论文,把世界模型拆分为渲染器、模拟器、规划器,为行业厘清概念;

7月收购机器人仿真公司SceniX;

9月发布Atlas,彻底打通“真实照片视频、3D空间、机器人模拟环境”的链路。

这条链路指向最大的商业化故事:

机器人训练的“数据荒”。真实世界采集数据昂贵,手工搭建仿真环境费时,而Atlas用几段手机视频就能生成供机器人反复训练的仿真空间。

具身智能若迎来爆发,世界模型就是卖铲人。

但冷静的审视同样必要。Atlas公布的评测中,对手模型只拿到文字提示,而Atlas拿到精确相机轨迹,对比并不完全公平;评测无第三方复现,无论文、无模型卡、无参数披露,目前仅闭源面向部分企业开放。

赛道上,杨立昆的AMI Labs、Odyssey、Niantic Spatial都在竞逐,国内的群核科技已经港股上市。Atlas的单项能力未必超过市面一流模型,它的意义在于方向,而非排行榜。

不过,李飞飞本人的履历是最硬的信用背书。

当年正是她顶着冷门建成的ImageNet,以1400多万张图片、2.2万个类别的体量(图片数约为同期主流数据集PASCAL VOC的719倍),点燃2012年AlexNet的深度学习革命,成为现代AI三大基石之一。

赌她的人,赌的是她第二次踩中历史节拍。

从科幻到生意,隔着一层清醒

《镜子》的结局是冷峻的:

绝对透明的文明走向枯萎。

而Atlas与镜子有一个本质区别:

镜子回放的是唯一客观的历史,Atlas生成的是无数逼真的候选世界。它的商业价值恰恰在“生成”而不在“还原”,这也提醒我们,世界模型时代,看起来像历史的影像不等于历史本身,每个人都该补上这课媒介素养。

对投资者和产业人而言,世界模型是下一个十年最值得跟踪的基础设施叙事:

短期看影视游戏创意的成本坍缩,

中期看机器人训练的数据解放,

长期看科学、医疗、教育的范式重构。

但也要看到,50亿美元估值里已经计入了大量预期,

技术仍处早期,商业化刚刚起步。

看清方向,也看清泡沫。

加载中...