推荐一个全新的Benchmark:看过高斯的AI,会梦到爱因斯坦么
(来源:硅星人)
作者|刘必可(微信zbthdx)
编辑|王兆洋(微信Geisterspiele)
最近,OpenAI 公布了 Navier–Stokes 存在性与光滑性问题的一份解答及 Lean 形式化证明。这是克雷数学研究所在 2000 年提出的七个“千禧年难题”之一,每题设有百万美元奖金。据 OpenAI 公告,其内部模型构造了光滑外力下的有限时间爆破:方程描述的流速在有限时间内变得无界。
与此同时,Levent Alpöge 和 Tristan Buckmaster 也公布了在 Claude、Codex 等模型协助下完成的流体方程研究,包括光滑外力下的三维不可压 Euler 方程结果。这些进展令人振奋,成果的理解与检验也仍在继续。
AI在不断突破数学难题的时候,也在我学习数学的时候,让我发现了很多有意思的事情。特别是在学习复杂数学定理的时候,往往当我将这个定理与前面学习过的定理,或者前面定理所包含的思想联系起来的时候,我才能学会。
渐渐地,我能看懂数学语言了。
有些定理的等式就是想把二维积分转为三维积分,因为三维的时候信息更多更方便理解,反过来有时候需要简便计算的时候就会换回二维积分,其实 Transformer 里面也有这种哲学思想,也就是先乘高维矩阵将特征放大,在找到特征后再乘低维度矩阵方便运算。
数学中反复会学到什么一致收敛了、绝对收敛了、依测度收敛了,其实我觉得它们很大一部分都是为了用这个很好的性质来交换积分号和求和号或者极限号达到简化计算的目的。
于是,有时候我有一点思路,就会问 AI:它们是不是同属一个系列的。
前面这些联系边界与内部的低维、高维积分转换,可以用广义斯托克斯公式统一理解。它们的共同的哲学思想就是边界-内部的对偶。简单来说,二维就是边界,比如球的表面;三维就是内部,比如球的内部。
这些哲学思想的识别其实都是需要经过大量的学习和感悟,从公式里读出思想、再把思想带到别的地方去,科学史上最有名的例子大概就是爱因斯坦了。他在苏黎世联邦理工读书时,听过盖泽尔(Carl Friedrich Geiser)讲高斯的曲面理论。
十几年后,广义相对论的数学形式让他一筹莫展,他后来回忆说,是在 1912 年突然想起高斯的曲面理论可能就是解开谜题的钥匙,意识到几何的基础有物理意义(随后朋友格罗斯曼又把他引向了黎曼几何)。高斯写下那些公式时想的是曲面和大地测量,爱因斯坦读出来的是引力。
所以我很好奇:一个看过高斯的大模型,会梦见爱因斯坦吗?
也就是说,它能不能从不同公式中读出相同的哲学思想。
如果可以的话,它是不是就能通过排列组合创作出很多新的公式呢。
于是,我们着手自己设计了一套目前市面上从没出现过的benchmark,不测模型任何具体数学题,而是想看一看模型究竟能不能理解数学的哲学,甚至是能不能像人一样去感受到数学的美妙。
1
从定理到思想
为了让大家感受到,其实数学没有想象的那么复杂,我先用一个简单的例子向大家介绍一个简单的哲学思想,也就是交换积分号求和号或极限。
以这次评测中的一条给 AI 的学习示例——Levi 单调收敛定理为例。
先看它的数学表达:设 (X, Σ, μ) 是测度空间,f₁、f₂、……是一列取值于 [0,+∞] 的可测函数,f 也是同一空间上的非负可测函数。如果对几乎处处的 x ∈ X,都有
那么
这里的积分都在整个 X 上进行,等式在扩展实数范围内成立,因此右边允许是 +∞。
看到这里,你可能会想:这叽里咕噜说的是什么,火星文吗?
但如果我告诉你,前面那些叽里咕噜的话,都是为了最后能够交换积分号和极限号,让我们可以在“先取极限得到 f,再积分”和“先对每个 fₙ 积分,再取极限”之间转换,选择更容易计算的路线呢?至于前面的单调递增、非负和可测,就是用来保证这次交换合法,排除那些交换之后结果可能不一样的特殊情况。这样看,这个定理是不是也没有那么难?
有没有注意到,这个定理的核心作用,就是在满足这些条件时,让积分号和极限号可以交换次序。这体现的就是“受控极限交换”这种哲学思想。
不同的公式、定理中,这种思想其实反复出现。这也是我设计这个 Benchmark 的初衷:
AI 能不能识别这种哲学思想?
因为如果我们把定理看作一件件数学工具,那么按哲学思想将其分类,就像按共同用途把它们放进不同的工具箱。如果AI可以识别不同细碎定理背后更本质的思想,它在推理阶段,就可以从一些具体琐碎问题跳脱出来,以一种更本质的方式挑出合适的工具。
这对今天的模型更好提高它的解决问题能力和效率,可能是个非常关键的提升方向。而这样一个benchmark也就会非常有价值。
1
数学定理的“哲学”思想识别 Benchmark
在设计题目的时候,我的一个基本方法是,把定理改写成白话,保留关键条件与结论,隐去名称和惯用公式,希望减少熟悉表达带来的答案线索,然后来测试模型的识别能力。
比如,刚才的单调收敛定理,在学习材料中就变成了这样:
这次选取八类哲学思想,每类提供四条学习示例,共 32 条。模型每次答题都能看到这八组示例,但类别只用 A—H 标记,不给名称或定义,让它从同组定理中归纳共同作用。
每道题包含两条表面相近的陈述:一条属于已学类别,另一条是数学上也应当成立、但设计上不属于这八类的对照,以减少仅靠排除类别作答的机会。模型先选出目标陈述,再给出类别代码。两步都符合当前候选答案,才计为答对。 后面的“两步全对率”就按此计算。
1
十个大模型是怎么理解的,又为什么会做错?
为了让大家直观地了解题目的难度,以及大模型的作答过程,我选了“边界—内部对应”这一类来举例。这是模型表现最差的一类,我自己学习时也觉得很困难。先看一个数学定理与物理规律相互联系的例子:一个是散度定理,另一个是热量守恒。
散度定理
热量守恒:
单看样子,你很难把它们联系到一起。但如果保留积分的骨架,把里面的内容换成白话,散度定理就变成:
这里把向量场理解为流量场。热量守恒则变成:
神奇的地方就在这里。
散度定理告诉我们,把内部各处的净流出加起来,恰好等于穿过整个边界的净流出,比如漏雨的屋子里,内部各处的净流出汇总起来,就是排水口流出的水减去屋顶漏入的水;热量守恒告诉我们,内部储存的热量减少多少,就意味着有多少热量净流出了边界,比如单独计算皮肤散热这一项,皮肤向外净散出多少热量,身体储存的热量就相应减少多少,散度定理在很多教材里也被称为高斯公式。
一个来自数学,一个来自物理,却都体现了“边界—内部对应”的哲学:区域内部的某种总体变化,可以通过穿过边界的流动来表达。
下面,我们看看大模型是怎么理解这种哲学和做题的。
先看三个模型对这一组思想的归纳。下面保留英文原文,中文是对应的翻译。
Gemini 3.8 Flash:
它还特意提到了泊松公式:
GLM-5.3:
它在判断题目时,又把这一组的主题概括为:
Step-5-Preview:
光看这些话,它们似乎都抓住了边界与内部的联系。但仔细读,侧重点已经有些不同:Gemini 更注意由边界数据确定内部,GLM 同时提到了边界值问题和内部累积,Step 则更注意内部积分与边界积分之间的转换。
这种区别,到了做题时就显出来了。
有一道题,讲的是怎样给内部的函数定义边界值。对于光滑函数,这很容易,把边界上的点代进去就行。但题目考虑的函数没有这么好,不能直接逐点读取边界值。定理告诉我们,仍然可以把光滑函数的边界取值操作推广过去,得到确定的、受到范数控制的边界数据。
先不管那些函数空间的名字,看它最后允许我们做什么:
从内部的函数,得到边界上的数据。
Gemini 想到了学习示例里的泊松公式,把这道题归到了“边界—内部对应”。GLM 却写道:
GLM 认出了定理,也看到了题目里确实存在的延拓操作。只是,它更注意“怎样把一个操作推广到更一般的函数”,于是选了“逼近与延拓”。按这次的候选答案,Gemini 分对了,GLM 分到了另一类。
Step 的情况又有些不同。它在推理过程中写道:
它已经看到了“边界限制”,却因为这里没有内部积分与边界积分的转换,一度排除了这一组。但这还不是它的最终答案。
接下来,它倾向于“逼近与延拓”,却没有就此交出答案,而是重新检查这一组的四个例子,继续追问它们的共同点。最后,2,048 token 的输出额度用完了,它还停在一句没写完的话上:
日志中的停止原因是达到输出上限,最终答案为空。因此,这份答卷既有分类上的犹豫,也有思考没有收束、答案尚未输出就被截断的问题。我们还不能知道,如果让它继续,它最后会选择哪一类。
可以发现,这些模型的表现来看,它们都能说出边界与内部有关,但这句话在各自的理解里,包含的东西并不完全一样。等题目换了样子,又同时出现边界值、延拓、函数空间,它们就会抓住不同的部分。
这也很像我们自己学数学的时候:听完解释,觉得懂了,还能复述出来;但换一道题,能不能认出那个关系,才开始考验我们到底懂到了哪一步。
1
十个模型的整体表现如何?
题目准备好后,我让十个大模型各做了三轮。每轮都是这 64 道配对题,调整类别的字母代码和展示顺序。这样,每个模型共作答 192 次,十个模型合计 1,920 次。
先看它们答得怎么样,再看推理用量和答题速度。下面的成绩都按完整 64 题、三轮作答汇总:既选对陈述,又分对类别,才算答对一次。评分依据是当前候选答案,其中有歧义的类别归属仍需继续核验。
原三轮实验中,我为每次请求设置了 2,048 个生成 token 的上限。可以把 token 理解为模型处理文字时使用的计量单位,它与汉字或单词并非一一对应。各家接口对推理的设置和统计方式不同,即使设了相同的上限,也不能据此认为模型用了相同的计算量。
答得好,需要多少推理?
先看下面八个模型的成绩。表中同时列出推理设置,以及接口报告的平均每题推理 token 数,方便对照。这里既有请求关闭推理或报告用量较低的模型,也有未返回完整用量的模型;“未返回”和报告为 0,都不能直接理解成模型没有进行推理。
这八个模型中,Claude 答对了 178 次,两步全对率为 92.71%,接口报告的平均推理用量约为 50 个 token。GPT 在请求关闭推理的设置下答对了 172 次,达到 89.58%。至少在这套题上,这两种设置下的成绩都比较高。
推理用量更高,成绩会更好吗?
另外两个模型报告的推理用量更高。Gemini 平均每题约用 577 个推理 token,是 Claude 报告值的十倍多,两者都答对了 178 次。MiMo 报告的用量更高,成绩为 105/192,达到输出上限而截断的作答按错计;不过,它的推理 token 统计存在异常,这个用量数字只能作为参考。
把十个模型放在一起看,报告的推理用量更多,成绩未必更高。不过,这里比较的是不同模型及其设置,尚不能据此判断:对同一个模型增加或减少推理,会让成绩怎样变化。
答得快的模型,表现如何?
除了答对多少,我也记录了每次请求从发出到收到答案的时间。按平均单题耗时从快到慢排列,结果如下:
Qwen 平均每题用时 1.13 秒,两步全对率为 83.33%;GPT 用时 1.72 秒,达到 89.58%。成绩最高的 Claude 和 Gemini,平均用时都在 4.3 秒左右。读这张表时,可以把速度和成绩放在一起看;这些耗时也包含网络传输和服务端等待,反映的是本次测试中的实际响应时间。
只看词频和文字重合,能拿到这样的分数吗?
看到这些成绩,还需要追问一步:题面虽然隐去了名称和公式,会不会仍有一些词语,足以提示答案?
为此,我让四种简单的文本方法也做了同一套题。它们根据词频、词组或词语重合程度等信息进行分类,同样从那 32 条学习示例中获取类别信息,也要同时选对陈述和类别。
按相同的 64 题、三轮共 192 次判断统计,结果如下:
这四种方法中,最高分是 50.00%,Claude 和 Gemini 则都达到 92.71%。这说明,本次测试的这四种简单文本方法,还不足以复现领先模型的成绩。模型究竟利用了哪些信息,下一节再继续讨论。
1
这些结果意味着什么?
在这套题上,Claude 和 Gemini 的两步全对率都是 92.71%,GPT 在请求关闭推理的设置下是 89.58%。它们明显超过了本次测试的四种简单文本方法。这说明,所测试的词频和文字重合方法不足以解释领先模型的分类表现。
这些分数也有需要一起看的背景。1,920 次作答中有 214 条无效或无法解析的输出,均计为零分;部分模型的低分受到输出失败影响。题集规模有限,模型原先见过哪些相关材料也无法完全确定。模型究竟在多大程度上依赖已有定理知识、语义匹配或关系推理,还需要进一步区分。
接下来,我们很快会开源部分题库,也会公开此评测对应的论文全文。我们会定期更新这套benchmark,并探索它与更多真实垂直场景结合来做模型评测的方式。同时,我们也期待和更多对此感兴趣的团队合作,探索各种可能。
πάνta ἀριθμός ,万物皆数。
包括AI。
祝大家国庆快乐。
点个“爱心”,再走 吧