模型还在加速,世界如何跟上?|北美AI交流手记
(来源:钛媒体APP)
这趟行程密度很大,后劲很足,回到上海后满脑子还是15天里的各种画面:
一边,有Frontier Lab研究员波澜不惊地向我描述他的日常:“我的工作主要就是监督和鼓励我的1万个agent。”有数学博士对我说:“数学已经死了。”
在Mountain View的Red Rock Coffee里,连续几天见的多位“天才少年”都坚定表示“一定会创业”,也有不到30岁的一线研究员开玩笑地说“要退休了”。
另一边,则是热火朝天的科技新闻:OpenAI发布了Astra、公布Navier–Stokes千禧年难题解答、Meta推出了用户增速超过ChatGPT的AI个人助理Muse、Dario大声疾呼“pace the frontier”居然得到了Elon和死对头Sam的响应......
新闻里的未来,和眼前研究员的日常,正在以一种奇妙的方式重叠。
同一轮浪潮里,人们正在经历不同的时间线
对于SevenX,我们始终相信,对任何技术和产业的理解,一定要站在最前沿、最一线,要和那些真正在其中挣扎过、绝望过、成功过的人去对话,才能完成一个关于未来的更全面、也更接近真实的拼图。于是9月初,带着新一轮的好奇和疑问,我在15天里横跨硅谷、洛杉矶、西雅图、波士顿和纽约,高密度地和101位新老朋友进行了不同颗粒度、但都非常有意思也极具启发的交流。
平均每天约7场对话,或是清晨的早餐,或是深夜的啤酒,或是三五人的咖啡小聚,或是十人的火锅分享,我们与北美AI一线从业者完成了一场从前沿方向到价值和梦想的对齐。
如果只记住一组数字:本次交流的101人,41位来自Google、Meta、Nvidia和OpenAI为代表的新老大厂;尤其是其中17位来自各Frontier Lab,42位是博士,82位在35岁以下,这是一群站在技术曲线最陡峭处的年轻人。
最年轻的一位21岁,2023年高中毕业,疫情之后才上大学,大三就选择从UPenn drop out开始创业,现在是北美一家AI应用公司的co-founder。
经历最丰富的一位,已经在“大厂—创业—大厂—创业”之间来回了两轮且横跨中美两地,归来仍在当打之年,财富早已不是追求,出于热爱,仍置身AI浪潮最前线。
有很多超级学霸和“天才少年”,但又分别有着独特而有趣的人生经历:有人本硕博集齐了CMU、Stanford、MIT,在校期间就已经参与很多前沿机器人项目;有MIT的博后转向业界投身于大厂数据中心的高性能计算;有Stanford物理PhD,毕业便加入了Infra方向的创业公司;也有拥有生物背景的Georgia Tech PhD,正在探索如何将AI与心理健康/脑科学结合。
有的直接向Sam Altman、Jensen Huang、Satya Nadella、Mark Zuckerberg等汇报或者合作;有的则是在创业和工程一线去解决一个零部件、一个运维问题。
他们站在AI Lab和其他实验室、数据中心、机器人产线、高校和交易大厅里,看到的是同一场技术革命的不同切面:有人在积极提升模型能力的上限,有人在尽力压低每一次推理的成本,有人在探索AI in the loop的科研新范式,也有人还在等一纸并网许可,等待期是5年。模型在按月进化,电网按年扩容,组织和人按自己的节奏适应。
这篇手记,就是从这样的时间差开始的。
先说我的观察:一线研究者对模型能力持续发展相当乐观——这种乐观不只来自在现有架构里继续堆数据和算力,更来自强化学习(RL)、任务环境(environment)乃至新架构打开的新扩展路径;但更强的模型,不会自动变成更好的交付,也不会让物理世界按同样的速度迭代。下一阶段的机会,可能不只在能力曲线最前端,更在能力、交付与现实之间尚未填平的落差里。
AGI已来?当造AI的人,也开始“等退休”
行程中,GPT-6 Astra正好发布。比发布会更让我印象深刻的,是好几场聊天里,各家大厂Frontier Lab的研究员们描述自己工作状态的变化:
“半年多前,觉得它还是research intern的水平,现在感觉已经超过我了。”
“我的工作主要就是监督和鼓励我的1万个agent。”
“每天工作时间很长,但也不算很满,因为有些时间就是去接杯咖啡,等我的agent出结果。”
还有不到30岁身价可能上亿的一线研究员半开玩笑地说,自己一两年后可能也可以“退休”了。
一位Lab的研究员朋友给了一组对比:“过去一个预训练团队一两百人,现在差不多二十人左右就能推进,一年后也许只需要五个人。”
从Human in the Loop,到AI in the Loop,变化已经不只是“多一个助手”。研究员提出方向,智能体写代码、跑实验、比较结果,再把新的线索交回来。人还在其中,但工作的重心正在从亲手完成每一步,转向组织一整套研究过程。关于AGI的定义仍然会争论,工作方式却已经真实和彻底地改变了。
一边是AGI在具体任务中已经无所不能的体感,另一边则是在大型组织的系统性实践中对于AI的投入、产出和客户的需求之间仍存在的落差:
Mert Demirer等人对超过50万名开发者的研究,把这种落差量化了。自主编码智能体带来的代码提交活动增幅为240%,项目数量增幅为80%,实际发布增幅则为30%。从提交到发布,提升一层层变薄。
正如9月初早上落地美国后的第一场交流,就把我从“模型又进步了多少”的兴奋里拉回了组织现实。几位来自某大厂技术相关的朋友,谈起前一天晚上刚收到的内部邮件:公司不再用AI采用率看板或token用量来评价员工的工作影响,而是回到产出质量、工作速度和所解决问题的复杂度。
朋友解释,之前把“用AI的量”放进考核,比如代码里有多少比例要由AI写,结果出现了大量bug;AI写的代码量又大,review起来非常困难,检查和修复的成本快速上升。硅谷甚至为此发明了一个词:Tokenmaxxing,也就是为了好看的指标刻意消耗token。
有同样变化的不只这一家。年初大家看到的是token价量齐升;后来发现,用了很多token,产出却好像一般。我们已经从“用更多”走到了“怎么用更好、ROI更高”的阶段。这一点不仅针对各家公司,也针对更多行业的下一步:Token是投入,代码量是中间产出,客户愿意付费的结果才接近价值。三者不能混为一谈。
Scaling,还能接着up吗?
从数据到智能,AGI的涌现正是scaling up的奇妙结果。那么,这件事儿如今到哪一步了?
两年前,我问过同一位硅谷核心模型研究员同一个问题:“数据是不是快用完了?还能scale吗?”这一次,他依旧给了我肯定的答案:
“一两年前我们训练数据的规模最多大概10T、20T,现在大家一般都在100T。目前看来还没有到天花板,估计还可以再往下走一代。现在的模型参数量基本上在1T到3T这个区间,下一代基本上是10到20T,应该在半年之内。”
和大家的聊天中,依旧能感受到对模型能力提升的乐观,以及对算力倍数级扩充的渴望。但有一些关键词已经变化,不再只是数据量和参数量,而是RL、environment和flywheel。乐观,并不意味着原来的路径没有遇到约束,而是他们看到了继续投入计算资源的不同路径。
“两三年前,大家还把RL看作垂直领域的‘精加工’;后来lab把多个垂直领域的RL合成一个大RL,它在训练中的比重逐渐超过了很多人的预期,有一些模型之所以明显更好,也因为在RL里放了更久。”
这带来一个根本变化:训练材料正在从静态的内容,扩展为可执行、可反馈的任务环境。模型不再只是“读”人类写下的东西,而是在沙盒里做事、观察结果、修正错误。谁能持续提供有价值的问题、真实多样的环境和可信的反馈,谁就可能在下一阶段占据重要位置。“环境”本身正在成为一种资产。
值得一提的是,“继续scale”并不只有一条路。正如Google Research负责人Yossi Matias说:“就在几年前,我们甚至还没有今天这样的架构,为什么要假设这就是唯一的路径?”就像Google几年前提出的投机解码(speculative decoding),在不牺牲质量的前提下,把大模型推理效率提升两倍以上。如今,已衍生出数百种变体,被业界视为理所当然。“但我在等10倍、100倍的提升,在等新的架构。”
所以,“还能不能scale”这个问题本身需要拆开看:在同一套架构里堆卡、加大预训练,边际收益确实在变化;但RL、环境,甚至全新架构,正在打开新的扩展维度。一线研究员的乐观,更多来自后者。
“数学已死”?下一个是谁
可能被作为AGI已经到来的另一个例证。近期,OpenAI宣布给出困扰了人类90年的纳维-斯托克斯方程(Navier–Stokes)千禧年难题解答(据OpenAI披露,动用了上万个agent、耗时88小时)。正是在那之后的几天,在波士顿一家超级火爆的川菜馆里,我和几位数学PhD聊起了AI和数学。
“数学已经死了。”这是我听到的最简短、也最直接的回应。另一位说:“半年前,AI对我的科研已经有非常大的帮助,但我不会的它也不会。现在,我不会的它会。”
对Frontier Lab来说,数学重要、基础,又天然可验证,因此投入了大量资源。但对于数学研究者来说,这种感受比新闻更私人,也带有很强烈的情绪。
“两三百年前,有数学家一辈子就做一件事,把一张对数表写成一本书。后来有了计算机,一辈子的事变成了一行代码。现在我们最聪明的数学家已经快比不过了。这只是一年之内发生的事。一两年前,AI第一次做出奥数题,大家还觉得稀奇。明年会是什么样子,不晓得。”
一道题的突破,让一个学科开始重新讨论贡献和未来。 当检索文献、提出假设、推导验算这些执行环节越来越便宜,价值就理应更多地流向提出问题、选择方向和判断结果的人。AI正在改变知识生产的分工,也在改变知识生产的权力分配。
然后,跳出实验室和数学界,和更广泛行业的从业者交流时,大家相对没那么悲观。原因很朴素:智能的背后依托数据与反馈。但人类社会有太多领域,标准说不清楚、结果模糊难以判定、无法形成数据闭环。
另一位前沿Lab的研究员也提到:“Coding通过用户交互和API,很容易形成flywheel,但在很多领域都没那么容易。如果要在其他领域也达到类似AGI的水平,按现在的配方,每个领域都需要一个flywheel。”
通用能力的提升,并没有自动消除这些困难——如何建立flywheel,依旧在很多行业中值得思考。正如新生代AI投资人代表Sarah Guo提到的:能被测量的,就能被训练;能被训练的,迟早会变成商品。而那些存在于私有环境、难以被简单量化,为客户连接系统、明确责任、保留状态、验收结果的“承重墙”,则可能长期存在价值。
对创业公司来说,需要思考的是随着模型能力继续发展,什么是在未来5年、10年后仍然存在的价值空间。尽管AGI已经把数学逼到墙角,也在coding上展现了绝对的统治力,但能回答好类似下面这些问题的创业公司,也许能有机会驾驭AGI或至少与AGI在商业世界中协同发展:
客户为什么把这件工作交给你?你能真正进入业务系统和工作流,而不只是给建议吗?什么叫完成,什么叫出错,如何验证?能否合法、持续地获得独有的结果数据并用于改进?
每瓦电力,能产生多少有效智能?
“能阻止AI毁灭人类的,可能恰恰是人类的无能”——这个脱胎于科幻小说《三体》的梗,已经照进了现实,因为我们连足够的电力和电网都无法提供给它。
AI算力基础设施已经从“比拼芯片采购与资本开支的扩张周期”,全面转向以电力容量、并网排期、供配电及液冷交付能力为核心约束的“硬约束周期”。正是在这个大背景下,在北美,我听到的两个瓶颈最为突出:
这在与我展开交流的工程师眼里,其实是一连串实实在在影响工程进度的追问:卡买到了,电什么时候到?电接上了,散热和网络跟得上吗?集群扩大后,故障怎么定位和修复?有多少设备在有效工作,而不是在等待或停机?更高的性能,能不能转化成更低的单位任务成本?
矛盾在逐渐放大,一方面是电力与交付的困难逐步上升,一方面是并没有衰减的胃口。一位在北美做GPU集群的朋友说的话,我至今印象深刻:“客户觉得这个cluster还得再乘个5,想要100万张卡,甚至更大的集群。我的天,谁给你来做100万张卡?”
这句“谁给你来做”,难的不是钱,而是物理瓶颈。粗略估算,一张高端GPU连同配套的网络和散热,功耗约1.5–2千瓦,百万卡集群就是1.5–2吉瓦,接近一到两座大型核电机组的出力;再叠加前面提到的5年以上并网等待,以及这种规模下的互联、故障定位和运维,它已经不是一个简单的采购清单,而是一项需要多年、跨越电网与土地审批的基建工程。
训练的胃口还在,而且还在变大。美国五大云厂商2026年AI相关资本开支约8000亿美元,2027年预计将升至1.2万亿美元,占GDP比重将超过19世纪末铁路建设以来的任何一轮技术投资周期。
也正因如此,小规模、分布式、靠近电源侧的方式,是这次听到最多的探讨。这样降低了选址门槛,但加大了运营难度。当然,这种方式对电的需求没有消失,只是换了位置,短期是权宜之计,长期则从开源节流两端,还有很多不同方案在同步推进,例如:
AI基础设施的竞争单位,正从“卡”变成“瓦”。能源侧的储能与柔性负载、数据中心运维、液冷、光互连,以及半导体设备链上的单点突破,都值得与模型机会放在同一张投资地图上看。
先造AGI,再造Robotics?
AI将如何最直接地影响原子世界,所有人的答案都指向了机器人(在此作为更广义的Physical AI的代表),而当聊到机器人时,北美的朋友们问我最多的一个问题是:“为什么国内这么疯狂?”这次交流的8位机器人从业者里,有头部大厂的资深科学家,也有一线做工程化的创业者。整体来看,他们对具身智能和世界模型的判断,都比国内谨慎不少:
第一,技术路线没有收敛。研究本身都还没有收敛,需要什么样的数据,大家还在“调配方”。决策者目前主要是研究员,他们更看重合作方能否理解需求、快速沟通和调整。硬件路线同样在争论。
第二,验证链条长。大模型可以快速迭代验证,具身的验证却需要真机,链条更长、复杂度更高。硬件的鲁棒性往往被低估:有时是硬件出了问题导致数据有偏差,最后却被误判成模型的问题。
当然,在北美,机器人迭代确实会更慢一些。“美国硬件不好搞,缺一个零件都买不到。”“很多采购的东西往往被其他美国公司套两三层壳,最终东西还是从中国出来。”但是,“具身相关的软件人才密度高很多”,好几位受访者都提到这一点。
不论目前的现状,Frontier Labs都正在具身上加码。OpenAI、Anthropic等都在大量招人、投入资源到具身,大家也就顺着开玩笑讲,或许确实是先造AGI,再造Robotics。
当然这个玩笑本身值得商榷。人的智能并不是先有大脑、再配身体,二者是在与物理世界的交互中共同演化的。更聪明的“大脑”可以缩短学习过程,却跳不过物理世界的反馈。从这个角度看,具身智能真正稀缺的,可能不是更强的基座模型,而是更快、更便宜的真机验证闭环——这恰恰是中国硬件供应链最有优势的地方,也是“国内这么疯狂”背后更理性的一面。
北美的大家状态如何?
这两周,我一边收到各种科技圈和投资圈的头条新闻,一边和新闻中相关公司的工程师和高管吃饭、喝咖啡,产生了一种很强的割裂感。那些AI进化论的叙事和资本市场的起伏,与研究员和工程师们的日常工作之间,温差很大。
9月,几位核心AI大厂CEO因担心AI失控而号召“给AI发展踩刹车”;7月以后,二级市场相关股票大幅下调并出现波动;一级市场更是几乎每3个月就完成一次热度周期转化。
与此同时,大厂和实验室的日常:该做的内部项目照样在做,该推动的进展依旧在进行,似乎并没有太大的波动。正如一位做infra硬件相关的朋友说:“身边情绪波动最大的都是搞二级,搞投资的,我们没啥变化。”而对于更多优秀的年轻人,也能看到他们依旧在认真思考如何更好地深入这股浪潮中,有人已然投身创业,有人在酝酿新项目,还有某些知名高校博导的学生刚入组已被预定,还没毕业就已经“财富自由”。
在绝大部分参与交流的一线科研人员身上,能感受到兴奋与压力的交织。跟我说可能要被AI取代、准备“退休”的科研大神,说这话时其实显得挺轻松。反而是聊到自己能参与这场巨大的盛宴时,能感受到他们发自内心的、很纯粹的满足感。
但同时,这种纯粹的背后,正如一位核心研究员的朋友所说:“少量业余时间打打单机游戏之外,基本没有生活,绝大部分时间都扑在模型研发上,也憋着一股做出新一代最强模型的劲儿。可能稍微不留神,别人就赶上来了。当然后来也习惯了,这是常态。”
另外,这次各个领域的受访者,对国内相关公司的情况都非常了解,甚至往往站在一个更客观、更全面的视角,无论是模型、机器人还是基础设施。我听着某大厂研究员对国内具身公司的实际技术水平和内部组织情况如数家珍,而且少了资本狂热带来的那层滤镜。同时也能感受到,在不少领域,中国本土的技术进展还是很被认可的。
结语:越来越强的AI,让什么样的人更重要?
把不同层次的现实放在一起,我对AI能力的持续进步更加乐观,也更清楚价值落地的难度。对于SevenX这样的早期投资者,很多交流发生在公司还没有成立、产品还没有成形的时候。我们需要理解一个人为什么看到了这个问题,以及更重要的,是每个人的特质、状态,以及如何应对这暴风骤雨般的变化:研究员的审美与抗压,工程师的务实与对交付的执着,博士们对职业路径和研究方向的重新思考,创始人走出成熟组织、从头创造一家新公司的勇气,以及对于所有人而言,当执行力被AI放大后变得更重要的判断力。
这次见到的很多人,已经有了令人羡慕的履历和工作,却仍在认真考虑下一步。有的准备离开成熟组织,有的继续留在实验室,也有人专注于一个看起来很小、却影响整套系统的问题。我想继续了解的,是他们如何把最初的兴奋变成持续的投入,以及在新的证据出现时,如何修正自己的判断。对SevenX来说,我们也一直在寻找有着这种精神底色的人:他们热爱驱动,独立判断,敢于挑战共识,也敢于否定昨天的自己,他们会长期留在游戏里。
下一次见面,我想问他们:这段时间,你把什么问题往前推进了一步?
模型还在加速。世界如何跟上,会逐渐体现在这些人的工作里,也体现在他们正在做出的选择中。
彩蛋:Fun Facts