新浪科技

刚刚,Claude Opus 5.5 来了!性能追平 Fable,成本暴降 40%

市场资讯 09.23 04:02

(来源:AI信息Gap)

同一天,OpenAI 紧接着发布了 GPT-6 Sol 和 GPT-6 Luna 模型,太卷了。小编疯狂码字中,一会见。

昨天,我们送走了来凑个热闹的 Grok 4.7。

今天,迎面向我们走来的是 Anthropic 代表队。登场选手 Claude Opus 5.5,口号「跑分登顶,成本暴降」。

大模型秋季运动会,正式进入下半场。

十天前,Anthropic CEO 发表了那篇呼吁「AI 该减速了」的长文。十天后,他自己公司抢先发布了一个在多项评测中排名第一的新模型。这脸打得啪啪响。

但有一说一,Claude Opus 5.5,很强。

作为 Claude 5.5 家族的第一个成员,Claude Opus 5.5 在大部分任务中达到了 Fable 5.1 的水平,而实际成本比上一代 Claude Opus 5 低了 40%。老粉们应该还记得,两天前我们刚爆料了 Anthropic 在后台偷偷灰度 Claude 5.2 全系列模型。结果 Anthropic 比谁都激进,直接跳过 5.2,来到了 5.5。

除了 Opus,Anthropic 手里还有 Claude Sonnet 5.5 和 Claude Haiku 5.5。首席产品官(CPO)Mike Krieger 已经确认,它们将在未来几周内发布。

编程,Claude 模型的老本行,Opus 5.5 几乎无敌。

Agent 编程评测 Terminal-Bench 4.0,Claude Opus 5.5 狂砍 66.4% 准确率。这是什么概念?GPT-6 Astra 57.9%,Claude Fable 5.1 55.8%,上一代 Claude Opus 5 只有 52.3%。你感受一下。

马斯克的 CursorBench 4.0,Claude Opus 5.5 和 GPT-5.6 Sol 差距更明显,57.8% vs 41.7%。

编程评测全部登顶,这在 Claude Opus 模型历史上也是第一次。

知识工作基准 GDPval-AA v2.1 测试 44 个真实职业场景下模型的工作能力。Claude Opus 5.5 拿下 1846 Elo 分,超过了 Claude Fable 5.1(1735)和 GPT-6 Astra(1542)。

「人类最后一场考试」HLE,Claude Opus 5.5 67.7%,依旧全场最高。

Anthropic 选择跳过 5.2,有点东西的。

在最新的 Artificial Analysis 大模型排行榜 v4.3 中,Claude Opus 5.5 以 58 分喜提第一,Claude Fable 5.1 和 GPT-6 Astra 并列第二,53 分。

另一个第三方评测平台 Vals AI 大模型指数,Claude Opus 5.5 以 37.13% 的得分拿下第一名,而且是首个在 LM Training 任务上超越公开参考标准的模型。

Anthropic 官方这样评价 Claude Opus 5.5,「在这个能力级别上,跑分已经不能很好地反映模型的真实使用感受了,我们自己的体感是 Opus 5.5 和 Fable 5.1 的差距比分数上看起来要小。」

Claude Opus 5.5,变得更有性价比了。

API 定价普降 20%,每百万输入 token 从 5 美元降到了 4 美元,输出从 25 美元降到了 20 美元。

但这还不是重点。重点在于 Claude Opus 5.5 的缓存读取从 0.50 美元砍到了 0.20 美元/百万 token,降低 60%。

我们之前聊过,你用 AI 写代码或者处理 Agent 任务时,每次调用模型,之前的对话历史都会以缓存的形式重新读入,这部分费用往往占总成本的六七成,甚至更高。缓存读取降低 60%,你写代码的实际花费能省将近一半。

划重点,Claude Opus 5.5 的降价对 Claude 订阅用户也生效,这个我们后面详聊。

根据 Anthropic 官方测试,在默认设置下完成同样的任务,Claude Opus 5.5 的总成本比 Claude Opus 5 低 40%。

Claude Opus 5.5 更便宜了,速度也更快了,输出比 Claude Opus 5 快 30%。不差钱的还可以开启快速模式,价格翻倍(输入 8 美元/百万 token,输出 40 美元/百万 token),速度最高提升 2.5 倍。

那么,Claude Opus 5.5 怎么用?

Claude 网页和桌面端,Claude Opus 5.5 已经是默认可选模型,在对话框里切换就行。

Claude Code,默认的 Opus 模型已经变成了 Claude Opus 5.5,看不到的先运行 claude update 命令更新一下 Claude Code。

API,Claude Opus 5.5 模型 ID claude-opus-5-5,在 Claude 开发者平台、AWS、谷歌云和微软 Azure 上都已经上线了。

你最关心的额度,Claude Pro、Max、Team 和企业用户的 5 小时额度限制提高了 20%。如果你用这个最新的 Claude Opus 5.5,因为它的定价低,5 小时额度和周额度又会多出 25%。

更更更重要的是,Anthropic 这次给所有订阅用户发放了一张额度重置卡。和 Codex 的额度重置卡一样,你可以自己选择什么时候使用,有效期到 10 月 22 日。

Claude Opus 5.5 写东西更有「人味儿」了。

编程模型的通病,不说人话。输出太啰嗦太绕,看着都费劲,这是上一代 Claude Opus 5 被吐槽最多的点之一。

硅谷企业成本追踪平台 Ramp 的一位高级工程师评价 Claude Opus 5.5,「它写东西就像一个靠谱的同事,而且能遵守我们给定的写作规则。」

还没来得及细测,但就我一下午的使用来看,Claude Opus 5.5 确实开始「说人话」了,中文。

Anthropic 要上市了。所以,它很急。

今天的 Claude Opus 5.5,可能只是个开场。

加载中...