新浪财经

GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

投资界

关注

原标题:GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

AlphaFold之后的最 大震撼来了。

刚刚,OpenAI 总裁 Greg Brockman转发的一条消息,足以引爆整个科技与医药圈。

知名科学家 Andrew Aiginin 在X上发布了激动人心的消息——

在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强AI!

不仅拿到了跑分第 一,Astra 还在短短 1 小时内,直接手搓出了复杂的抗体机理交互式可视化页面。

一直以来,圈内都有一个共识:「AI for Science,必须是用专用的模型,打专用的问题。」

比如 AlphaFold 之于蛋白质折叠,LLM通常只被当成写代码和读文献的辅助工具。

但今天,GPT-6 Astra 将这个共识撕开了一道巨大的口子!

它依靠通用智能,直接切入了生物医药研发中最难量化、最令人头疼的临床前死穴。

而这一切并非偶然。构建该测试基准的顶 尖AI 制药团队Insilico Medicine在 arXiv 上放出一篇21页重磅论文

标题:Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

论文:https://arxiv.org/pdf/2608.18940

这篇论文,不仅首次揭开了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,更向我们展示了:从小分子化学合成,到大分子抗体预测,通用大模型正在全面接管最硬核的科学边界!

AlphaFold 之后的科学范式转移,或许才刚刚开始。

37.98分!GPT-6登顶权威「DDD基准测试」

实测结果显示:GPT-6 Astra 接入 DDD Benchmark 中的抗体可开发性测试模块(综合了 6 种不同的抗体实验数据)后,拿下了惊人的 37.98 分,碾压了所有受测模型。

AI 学者 Rim Shayakhmetov 发出难以置信的惊叹:

「专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在『不依赖外部专用工具』的情况下如此闪耀!」

没有专业生物信息学插件、没有专门做抗体数据微调的情况下,一个通用大模型,居然直接切中了抗体成药性的命脉,这太令人兴奋了。

发现抗体只是开始,「成药」才是真正的死亡之谷

要理解 GPT-6 Astra 这一成绩的含金量,我们首先得弄懂一个医药界的残酷现实。

Andrew写下了一句直击灵魂的话:「找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?」

这句话,道出了全球无数新药研发人员的血泪史。

在过去,当我们谈论抗体药物研发时,大家最关注的是「结合力」。

通俗点说,就是这个抗体能不能精准地像钥匙插进锁孔一样,识别并结合到病毒或癌细胞的靶点上。

早期的AI模型(比如AlphaFold)已经在「预测结合」这件事上做得非常出色了。

但是!能结合 ≠ 能变成药。

这就好比谈恋爱。男女双方看对眼了,一见钟情,这只是第 一步。你们能不能走进婚姻的殿堂?能不能经受住柴米油盐的考验?

在药物研发中,这个「柴米油盐的考验」被称为「成药性」。

现实中,无数看似结合力极强的「完 美抗体」,一旦进入真实的生理环境或工业生产环节,就会暴露出致命缺陷:

它会不会聚集成团?

它的结构稳不稳定?

它到底能不能表现得像一款真正的「药」?

这些属性统称为抗体可开发性。

这是整个生物制药界的「死亡之谷」。

它导致了一个极其惨烈的局面:全球每年有成千上万个抗体分子在实验室里表现优异,但最终倒在了「成药性」的评估阶段。

药企为此烧掉了几十亿美金,耗费了几年甚至十几年时间,最终颗粒无收。

而今天,GPT-6 Astra 宣布,它能比目前世界上任何其他前沿模型,更精准地预测这些成药性特征。

揭秘试金石:GPT-6 Astra 面对的「地狱级」基准测试

有人可能会问:这会不会又是一个「刷榜」成绩?

绝 对不是。

Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台是他们构建的 DDD Benchmark。

在他们发布的论文中,我们看到了这个测试体系多么硬核。

虽然推文讨论的是「大分子抗体」,但这篇论文展示了该团队在「小分子化学」领域建立评测标准的恐怖深度。了解了这个背景,你才会明白 Astra 的夺冠有多么不可思议。

论文中,研究团队聚焦了另一个制药界的世纪难题:单步逆合成。

简单来说,逆合成就是「化学界的倒推法」——给你一个目标药物分子,你需要倒推出可以用哪些现成的、便宜的化学原料来合成它。

过去的 AI 评测是怎么做的?

给 AI 一个目标分子,AI 吐出一个合成路径,如果跟已有的专利数据库(比如 USPTO)里的一模一样,就算 100 分。

但这在真实世界里几乎行不通。因为合成路径天生就是「一对多」的,传统的「单一标准答案」评估法,极大地限制了 AI 探索未知的能力。

为此,Insilico 团队构建了令人发指的测试环境:

1.URSA-expert-2026 基准: 这是一个包含 100 个由机器生成、并由顶 尖人类化学专家手动确认合成可及性的全新分子数据集。它与任何公开的训练数据完全隔离,彻底杜绝了模型「背题」的可能性。

2.ChemCensor 打分系统: 他们不看模型是不是完 美复刻了专利,而是开发了 ChemCensor 框架,从「反应中心映射」、「官能团兼容性」等最 底层的化学物理规则出发,去判断模型生成的反应是否具备真正的化学合理性)。

正是在这种「剥壳见骨」的物理/化学规律考核下,传统的 LLM几乎都失败了。

在早期的 Top-1测试中,哪怕是强如 GPT-5.5、Gemini 3.1 Pro,其表现依然无法超越最顶 尖的专用传统化学模型(如 MHNreact、LocalRetro)。

「大力出奇迹」的通用 LLM ,似乎碰壁了。

4500万数据,LLM被「逼出」科学直觉的?

通用 LLM 拼不过专用模型,那该怎么办?

论文给出的答案震撼了业界——不要换模型,换一种激发通用模型潜力的方法。

研究团队在论文中提出了三大杀招,彻底解锁了大模型在化学领域的封印:

第 一招:Top-K 提示词范式

既然逆合成是「一对多」,那就不要让 LLM 只猜一次。

团队在 Prompt 中明确要求:「给我 15 种不同的答案」。

奇迹出现了,仅仅是切换到 Top-K模式,几乎所有的大模型(GPT-5.5, Claude Opus系列)在化学合理性和多样性上都迎来了爆发式增长。

Gemini 3.1 Pro 在 Top-15 模式下性能飙升,直接成为最强 LLM 基线。

这证明,大模型是有科学知识的,只是过去的提问方式不对。

第二招:构建 4560 万规模的超大核验数据集(CREED-CCV-2+USPTO-XL)

为了训练出专门针对化学限制对齐的语言模型(C3LM),团队不惜算力,利用虚拟合成引擎和 ChemCensor 框架,硬生生构建了一个包含约 4560 万个经过验证的真实化学反应的超大规模数据集。

第三招:强化学习中的新颖性奖励

在微调 C3LM 模型时,他们引入了 GRPO 强化学习算法。

奖励函数极其刁钻:模型给出的合成路径不仅要符合 ChemCensor 的化学合理性,而且如果模型能想出一种连 4500 万训练集里都没有、但依然合理的全新反应,将会获得额外的巨大奖励。

结果是什么?

经过这种「地狱级」训练的 C3LM 模型,在 URSA-expert-2026 盲测中,终于一举击败了 MHNreact 等所有传统专用 SSRS 模型!

数据分析显示,C3LM 和其他基础大模型能够探索出与传统模型完全互补的反应空间,生成了大量传统模型想不到的独特路径。

论文的核心结论是:大语言模型不仅能处理自然语言,只要给予正确的环境和激励,它们完全可以掌握最深奥的化学键、官能团和合成逻辑!

降维打击:从 C3LM 到 GPT-6 Astra,通用智能的全面接管

如果你看懂了上面这篇论文,你就会明白 Bogdan 博士为什么会把 GPT-6 Astra 的成绩和这篇论文联系在一起。

在这篇论文中,Insilico 团队费尽九牛二虎之力,用 4500 万条数据微调、用强化学习对齐、用 Top-K提示词引导,才终于让大模型在小分子化学合成上打败了专用模型。

然而,当测试赛道切换到更加复杂、维度更高的大分子可开发性预测时,GPT-6 Astra 居然在「没有使用外部工具」的情况下,直接在同样的 DDD Benchmark 测试体系下登顶,拿下了 37.98 分!

这绝 对是降维打击

过去,我们要解决抗体稳定性问题,需要专业团队设计专门的三维图神经网络。

而现在的 GPT-6 Astra,它的通用世界模型中似乎已经内化了物理、化学、生物的底层逻辑。

它在阅读了人类历史上浩如烟海的论文、专利、实验数据,甚至通过多模态学习了微观世界的物理法则后,已经能像人类专家一样,「直觉」判断出一个蛋白质分子在溶液中为什么会聚集。

此外,Astra 展现出的工程效率同样令人胆寒。

Andrew Aiginin 提到:「顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。」

在传统药企,做这样一个系统,整个流程少说也要两三周。

现在,1个小时,一个人,一个通用大模型,就能解决了。

AlphaFold 之后,真正的范式转移

GPT-6在抗体基准上的跑分第 一,宣告着通用大模型已经显出AGI雏形,在人类最顶 尖智力活动中取得的实质性统治。

这个榜单第 一,宣告了这个新时代的到来——

未来十年,科学发现的核心驱动力,可能不再是为每一个孤立的科学问题定制一个专门的 AI 模型;而是学会如何向一个如同神明般的ASI提出正确的 prompt。

小分子逆合成被突破了,大分子抗体成药性被突破了。

从新药研发到材料科学,从聚变控制到量子物理,通用大模型的外溢红利,即将如海啸般席卷所有硬核行业。

加载中...