让 AMD 怒掏 82 亿美元的“新世界”,到底是啥?
(来源:网易科技)
世界模型炒了这么久,到底值不值?
不知道各位差友怎么想,反正大结果是让它拿到了。
9 月 29 日,AMD 宣布斥巨资 82 亿美元,拟收购李飞飞的创业公司 World Labs,并聘请李飞飞担任 AMD 的执行副总裁兼首席科学家。
如果只看这笔收购价,可能很难理解 AMD 到底看中了什么。
但你要是把李飞飞这二十几年的履历扒一扒,会发现她从头到尾其实在干一件事:教机器睁眼,看看我们这个三维世界。
2009 年,李飞飞带领团队推出 ImageNet,用海量标注图片为机器视觉建立了一套共同的训练和测试标准。
三年后,深度学习在 ImageNet 竞赛中取得突破,也让这项研究成为 AI 发展史上的关键一站。
不过,能认出图片里的物体,只是 AI 长眼的第一步。物体在哪里,彼此是什么关系,人走进场景后又会发生什么。。。这些问题,就成了 World Labs 的起点。
而他们研究的重点,让 AI 看懂物理世界,可能正是下一轮神仙打架的主战场。
不说别的,至少投资圈已经被世界模型钓成翘嘴了。
根据创业投资数据平台 Dealroom 今年年中的统计,世界模型初创企业在 2026 年已经拿到了约 32 亿美元融资,超过去年全年。
顶着 “ 教母/教父创业 ” 和 “ 世界模型 ” 的双重光环,光是李飞飞的 World Labs 和杨立坤参与创办的 AMI,两家公司今年宣布的融资就各在 10 亿美元上下。
有投资人表示,这波世界模型的投资热潮,甚至比上一波机器人还要猛烈。
而就在 AMD 给世界模型赛道,开出迄今为止最高的收购价后,李飞飞发表了一篇名为 “ 探索新世界 ” 的博客,引用了《 尤利西斯 》中的一句诗:
“ 来吧,我的朋友们,现在去寻找一个新世界还不算晚。”
燃,很燃啊。世超刚刷到这篇博客的时候,确实被那种开辟新世界的史诗感击中了。
但冷静下来再看看,寻找一个新世界好像也没那么简单。世界模型领域,一直面临着不小的争议。
就说最基本的定义问题,投资人嘴上喊着世界模型就冲过去了,可所谓的 “ 新世界 ” 到底长啥样,业内至今甚至连个准话都没对齐。
即使都打着 AI 进入物理世界的旗号,不同领域的世界模型都在各玩各的,效果也是参差不齐,一片混沌。
世超总结了一下,目前主流的世界模型路线大概分成三种:预测视频画面的、提取抽象状态的、重建空间结构的。
预测视频的路线,最常见在自动驾驶和机器人,谷歌的 Genie 也算是这个方向。
比如小鹏的 X-World,它的原理简单来说,就是给模型看车辆刚刚拍到的路况,指定下一步操作是直行还是变道,再让模型输出后续的视频画面。
它的用途,是通过这种视频仿真,反复测试自动驾驶系统的可靠性。
谷歌的 Genie 也差不多,同样是输出视频,只不过把汽车驾驶操作,换成了键盘上下左右键。
你按下方向键,它就根据你的操作实时生成下一帧画面,让你在一个虚拟世界里边走边探索,营造出一种开放世界无限流游戏的感觉。
而另一种提取抽象流世界模型,则是 AI 教父杨立坤的原创。他研究的 JEPA 系列,主打一个抓重点。
JEPA 会先观看大量真实视频,从里面抽象出真实世界中物体移动,相互作用的规律。
在实际工作时,比如看到一个杯子被推向桌沿,它要抓住的重点,是杯子失去桌面支撑后,大概率会往下掉。至于杯身反光、桌上的花纹,就没必要关注。
JEPA 系列的终极目标,是靠模型抽象出物理规律,让 AI 从根本理解现实世界。
可以说,上面两种世界模型,重点都放在了预测世界会怎么变。
而李飞飞的重建空间结构流,是希望把三维空间直接搭出来,能直接进行交互。这样世界会怎么变就可以靠观察,不用再去猜。
这个分支的原理其实最好理解,它和大模型差不多,输入文本、图片、视频等多模态数据,最终模型可以输出一个可玩可交互,可以反复探索使用的 3D 世界。
模型会结合照片的拍摄位置和角度,推测物体在三维空间里怎么摆,没拍到的地方,再合理推测补全。
目前,World Labs 先后展示了三款世界模型,代表产品有去年十一月的 Marble,和今年九月刚发布的 Atlas。
讲到这儿,或许大伙儿的某些记忆已经被唤醒了。
实际上,不管是 World Labs 的 Marble/Atlas、还是谷歌的 Genie、再到 JEPA,都曾靠各种炫酷的 DEMO 引发过广泛的关注和讨论,比如 “ 一句话生成塞尔达 ”,“ 一张图做出我的世界 ” 之类的。
但资本和公司吹得很热,世界模型的实际效果却往往很尴尬。
目前,世界模型只能说可以生成可探索的场景,也能用于一些最基础的仿真和内容制作,但大规模应用起来,性价比太低。
世超曾经试玩过 World Labs 的 Marble,不客气地说,实在是画面卡顿,画质粗糙。。。
它生成的场景主要靠三维高斯泼溅来呈现,看着是有空间感,但要说体验嘛,我只能说不如打开荒野大镖客。
而无论是训练模型,还是部署后实时交互,都需要处理海量的空间、图形数据。
这意味着它未来的算力需求,大概率比现在的大模型还要高得多。这可能也是 World Labs 迫切想要抱上 AMD 大腿的原因之一。
但不得不说,AMD 这次入场,至少给了世界模型一个往前走的机会。
以前模型和芯片各玩各的,就算物理 AI 想进化,芯片也不知道怎么递铲子。
现在双方合作,或许真有机会把速度提起来,把价格砍下去。
AMD 宣布收购计划后,不少人觉得这钱出得太早,出得不值。
可就像当年没人能预料到大模型会在那一夜爆发一样,AI 真正踏进物理世界的那一天,可能也会来得猝不及防。
到那时候再回头看,今天这 82 亿美元的买路钱,也就不算贵了。
撰文:莫莫莫甜甜
编辑:江江 & 面线