同一天,OpenAI 紧接着发布了 GPT-6 Sol 和 GPT-6 Luna 模型,太卷了。小编疯狂码字中,一会见。
昨天,我们送走了来凑个热闹的 Grok 4.7。
今天,迎面向我们走来的是 Anthropic 代表队。登场选手 Claude Opus 5.5,口号「跑分登顶,成本暴降」。
大模型秋季运动会,正式进入下半场。
十天前,Anthropic CEO 发表了那篇呼吁「AI 该减速了」的长文。十天后,他自己公司抢先发布了一个在多项评测中排名第一的新模型。这脸打得啪啪响。
但有一说一,Claude Opus 5.5,很强。
作为 Claude 5.5 家族的第一个成员,Claude Opus 5.5 在大部分任务中达到了 Fable 5.1 的水平,而实际成本比上一代 Claude Opus 5 低了 40%。老粉们应该还记得,两天前我们刚爆料了 Anthropic 在后台偷偷灰度 Claude 5.2 全系列模型。结果 Anthropic 比谁都激进,直接跳过 5.2,来到了 5.5。
除了 Opus,Anthropic 手里还有 Claude Sonnet 5.5 和 Claude Haiku 5.5。首席产品官(CPO)Mike Krieger 已经确认,它们将在未来几周内发布。
编程,Claude 模型的老本行,Opus 5.5 几乎无敌。
Agent 编程评测 Terminal-Bench 4.0,Claude Opus 5.5 狂砍 66.4% 准确率。这是什么概念?GPT-6 Astra 57.9%,Claude Fable 5.1 55.8%,上一代 Claude Opus 5 只有 52.3%。你感受一下。
马斯克的 CursorBench 4.0,Claude Opus 5.5 和 GPT-5.6 Sol 差距更明显,57.8% vs 41.7%。
编程评测全部登顶,这在 Claude Opus 模型历史上也是第一次。
知识工作基准 GDPval-AA v2.1 测试 44 个真实职业场景下模型的工作能力。Claude Opus 5.5 拿下 1846 Elo 分,超过了 Claude Fable 5.1(1735)和 GPT-6 Astra(1542)。