哈佛教授90天横扫18个学科,Claude神助攻!连开36篇论文
(来源:新智元)
新智元报道
全世界拿AI搞科研的姿势,可能从一开始就用错了!
哈佛物理学家、量子场论教材作者Matthew Schwartz找到的正确姿势,恰恰是别把Claude当科学家。
他把Claude够不着的深层问题留给自己,只挑它最擅长的题交给它。
结果,他熬了好几周、逐行写代码才完成的计算,Claude只跑了20分钟就复现了,连他自己都没想到。
他又多追问了一句,Claude在接下来几周里算出15个费曼积分,这些积分此前从来没有人算出来过。
三个月后,Schwartz手里多了36篇论文初稿,从对撞机里的粒子做到了巴拿马雨林里的树,横跨18个学科。
10月1日,Anthropic把他的长文发上了官方科学博客,标题叫「Claude形状的科学」。
他在文中给出的理由是,今天的大模型很擅长做科学,但还算不上科学家。硬把它当成人类科学家去使唤,它的本事反而发挥不出来。
想让AI变强,有两条路。一条是等巨头在实验室里堆出下一代模型,另一条就是拿到模型的人,自己找到对的用法。
哈佛教授挖出了Claude最强的一面
去年12月,Schwartz让Claude Opus 4.5给自己当科研助手。用他的话说,Claude像一个能干的研究生,干活快20倍,论文最后写出来了,过程却很磨人。
很多科学家都有类似的体会。新闻里AI一会儿解开数学难题,一会儿刷新纪录,自己上手一用,却总觉得隔着一层。
这种落差,在他看来有迹可循。AI科研的新闻头条大多出在数学里,那是唯一能把问题完整写下来、答案能被绝对验证的学科,可大部分科学并不长这样。
他借了物理学里的一个词,叫「阻抗不匹配」,两个系统各自运转良好,接在一起却配不上。放到AI科研上,一头是科学家想要的,另一头是AI最擅长的。
于是他按Claude实际的样子来用它。Claude眼下帮不了他想深层的概念问题,可它几乎什么领域都懂,写代码是强项,读论文和数据也是机器的速度。
他要做的,就是专挑正好落在这些长处上的题。这类题,他叫作「Claude形状的问题」。
科学家想做的事和AI能做的事只在两小块地方重叠,那里就是「Claude形状的问题」
追问一句,算出15个新积分
第一个Claude形状的问题,他从老本行里挑,叫散射振幅。
物理学家要靠它从对撞机的碎片里认出新粒子。可它的核心是费曼图背后的多维积分,难一点的,算出一个就够写一篇博士论文。
为了绕开这些难算的积分,过去20年,物理学家发展出一条捷径,叫S矩阵bootstrap。它不硬算积分,靠物理约束一层层排除。
比如,知道振幅在哪些地方会变成无穷大,候选就缩到2万个,再加一个对称性,剩下500个,就这样一步步缩到1个。约束不够用的时候,再在几个点上把振幅算到极高的精度,把剩下的系数钉死。
在Schwartz看来,这道题天生适合AI。一来,它要的数学、物理和计算机知识没人能全部掌握;二来,答案能被验证,跑两个脚本就能对到任意位数,Claude想糊弄也糊弄不了。
他交给Claude Fable 5的第一件事,是把散落在各种代码和论文里的方法搬进同一个框架。结果,Claude很快复现了他的旧结果,还指出他有个算法写慢了。
突破出在后面。他让Claude去找还没人算过的振幅,发现它一直把自己限制在最简单的对数函数里,于是追问了一句,更难的椭圆函数能不能也这么做。
这一问问到了难处。人类完整算出的椭圆费曼积分只有寥寥几个,还没有一个完全靠bootstrap算出来,因为所需的知识散在许多人身上,从来没人试过。
Claude却没有这个障碍,它把整套工具扩展到了椭圆函数上,大部分新软件由它自己写,剩下的借自数学界。
几周后,30个积分被从头到尾算完,一半是复现已知结果,另外15个此前从来没人算出来过。
回头看这几周,Fable 5的能力是底子,决定结果的是两次选题,一次是挑中这道能验证、知识又分散的题,一次是看出Claude在给自己设限,追问了一句。
其中第二次更关键,那批前人从没算出来的积分,全出在追问之后。
这套越用越全的工具,Schwartz起名叫BootLoops。它是套在大模型外面的一层工具和流程,已经开源,换哪家的模型都能驱动。
其中两个积分引擎的算法,出自北京大学马滟青团队。
门槛有多低,我们自己试了一下。在一台Mac上装好BootLoops后,我们只用一句话给Claude Code交代任务。
它自己翻文档、找工具,20分钟出头、花了约1.5美元,就把官网上一个新算出的积分系数重算了一遍,还找出了闭式,和数值对上157位。
一套积分,打穿18个学科
本来,Schwartz打算就这批积分写篇文章收工。可科学里有个巧合,同样的方程总会在不同学科里反复出现,这批工具的用处远不止物理。
Claude告诉他,这些积分还能对应到群体遗传学里的贝叶斯证据积分。
系统发育学用DNA给物种排家谱树时要算的积分,和BootLoops当初为费曼图打造的积分也是同一类。
BootLoops为费曼图造的积分工具,在物种家谱、群体遗传和生态学里都能用
为了让工具箱越用越全,他给Claude立了条规矩,老工具要用,新工具也要造。
这样一来,每个项目哪怕失败,都会留下新工具,Claude越用越能干,用他的话说,就像《黑客帝国》里刚灌完功夫的尼奥。
也就是说,模型能做成多少事,不只取决于权重,也取决于手边的工具箱。下一代模型要等实验室发布,工具箱却每天都在扩充,和模型打交道的人自己就能改进它。
工具箱带进别的学科后,生态学最先出了成果。中性理论认为,森林里物种的兴衰也许全凭运气。
可这个理论的方程写出来20年,一直没人能在大尺度上解开。Claude认出这是BootLoops形状的题,把它解了。
拿巴拿马运河巴罗科罗拉多岛的普查数据一对,树种组成的变化速度比中性理论允许的快了4.5倍,光靠运气解释不了。
于是,他和植物生物学家James O'Dwyer用Claude搭出新模型,把物种之间寿命、生长和繁殖的差异加了回来,正往全球的森林样地推广。
其他学科也陆续出了结果。群体遗传学里,他们在57亿对相邻突变中找到了基因转换的证据。
经济学五大顶刊4452篇论文的复现包,被搬进开源代码逐个核对,语言学家也拿到了覆盖6072种语言的重音数据库。
数学家Watson在1939年开启的格点积分系列,最后一道难题也被解开了。
这些成果加起来,就是那36篇论文稿。它们是Schwartz从约400个候选问题里筛出来做成的,目前都还没正式发表。
Schwartz在文末披露,项目期间他在Anthropic担任访问研究员,BootLoops由Anthropic资助,由他本人拥有和维护。
撑起这个产量的工作台并不复杂。每个项目一个Claude Code会话,一个总控会话负责协调和验收,计算交给后台子Agent。
还有一个会话专门扮演挑刺的审稿人,把结果翻来覆去地核查。
一个总控会话管着一群项目会话,计算交给后台子Agent,另有会话专门挑刺
Claude做成的这些题有一个共同点,答案都能被核对。
正因为算错了瞒不住,Schwartz才敢放手让它去跑。所以说,能被验证的地方,AI就能放开手往前推。
通往ASI的另一条路,谁都能走
Schwartz这三个月,回答的是一个更大的问题,智能到底靠什么扩张。
外界衡量AI有多强,看的几乎全是模型本身,参数多了没有,跑分高了没有,下一代什么时候发。
Schwartz看的却是另一件事,模型的上限由实验室决定,最后能发挥出多少,取决于挑题、搭工具、定验收标准的那个人。
至于AI该去哪儿,他用了一个数学概念来比喻,叫凸包,也就是把一个形状所有尖角连起来后,围出的最小凸形状。
人类知识就是这样一个参差不齐的形状,生物学往一个方向突出去,数学往另一个方向突出去。
一个实验室可能花20年,用一种方法把一组基因研究透,旁边的基因和别的方法却一直荒着。
那些人类够得着、但还没有哪个人去过的中间地带,最适合交给AI。
BootLoops做的,就是在这些尖刺之间连线,把凸包一点点填满。
人类知识像一颗参差不齐的星形,BootLoops的工具包在尖刺之间连线,填补中间的空白
AI去填这些空白,人在科研里的位置也跟着变了。
局面变得太快,几乎没法提前规划。Schwartz反问,一个AI可能一夜之间就算完的问题,为什么还要申请三年的经费去算。
连该怎么带研究生,他也说自己至今还没想清楚。
不过在他看来,只要找对问题,大部分技术活都能自动化,离不开人的是概念那一部分。
放到通往ASI这件事上,也是两条路。一条是等实验室训出更强的模型,另一条是把人类散落在几十个学科里的工具拼成一个工具箱,交给一个什么都懂一点的模型,再由人来挑题、追问、验收。
前一条路握在少数几家公司手里,后一条路不用等下一代模型,每个会用AI的人现在就能走。
参考资料:
https://www.anthropic.com/research/claude-shaped-science
https://x.com/anthropicai/status/2105733864152858919
编辑:摩西