新浪科技

谷歌继续挤牙膏!Gemini 3.6 Flash 刚刚上线,3.5 Pro 还在难产

市场资讯 07.22 06:00

(来源:AI信息Gap)

关于谷歌,你在期待什么?

6 月 9 日,Anthropic 发布 Claude Fable 5,模型综合榜单至今第一。

7 月 9 日,OpenAI 发布 GPT-5.6 Sol,Fable 5 终于有了像样的对手。

7 月 16 日,月之暗面发布 Kimi K3,2.8 万亿参数,全球最大开源模型。

7 月 19 日,阿里紧跟着放出 Qwen3.8-Max 预览版,2.4 万亿参数。

而就在刚刚,谷歌也发布了新模型。

Gemini 3.6 Flash。

还有 3.5 Flash-Lite 和一款只对政府开放的 3.5 Flash Cyber。等了两个多月的 3.5 Pro,依旧「搁浅」。

Gemini 3.6 Flash 有进步,但不是你期待的那种进步。

运行同一个长周期编程任务 DeepSWE,3.5 Flash 平均消耗 27.6 万输出 token,3.6 Flash 只用了 9.7 万个,省了 65%,模型的输出定价也从每百万 token 9 美元降到了 7.5 美元。

所以,谷歌今天的新模型,主打的是 token 效率。也就是:替你省钱。

单纯看模型性能,Gemini 3.6 Flash 没有多性感。

长周期编程测试 DeepSWE 从 37% 提升到 49%,机器学习研究基准 MLE-Bench 从 49.7% 涨到 63.9%,操控电脑测试 OSWorld-Verified 从 78.4% 涨到了 83.0%,和自家上一代比确实每一项都有提升。

但这种程度的提升,太小了。

不信你看第三方测评机构 Artificial Analysis 的排行榜。

Gemini 3.6 Flash 综合得分 50。Gemini 3.5 Flash,也是 50 分。升级了一代,分数一模一样。

AA 排行榜覆盖了 187 个模型,3.6 Flash 目前排在第 11 名。在它前面站着一众大佬,Claude Fable 5 60 分、GPT-5.6 Sol 59 分、Kimi K3 57 分、Claude Opus 4.8 56 分、GPT-5.6 Terra 55 分、Grok 4.5 54 分、Claude Sonnet 5 53 分。

谷歌 Gmeini,连前十都进不去了。

谷歌也是懂宣传的,官方博客通篇只和自家模型比,3.1 Pro、3.5 Flash、3.6 Flash,柱状图从左到右越来越高。

单看上面那张跑分图,你甚至会觉得 3.6 Flash 挺强的。

但作为曾经的「御三家」,谷歌的目标显然不止于此。和 GPT-5.6 Luna、Grok 4.5、Claude Sonnet 5 相比,综合软件工程测试 SWE-Bench Pro 3.6 Flash 58.7%,其他三家分别 62.7%、64.7%、63.2%;DeepSWE 差距更大,3.6 Flash 仅得 49%,GPT-5.6 Luna 67%。要知道,GPT-5.6 Luna 是 GPT-5.6 系列最弱、最便宜的版本。

性能卷不动,谷歌也来卷效率和性价比了。

我为什么用了「也」这个字呢?因为在 Gemini 3.6 Flash 前面,早有老马的 Grok 4.5 瞄准了这个赛道,同样主打性价比,目前风评还不错。

5 月份的 I/O 大会上谷歌当着全球网友的面承诺,Gemini 3.5 Pro 下月发布。然后就没有然后了。

据爆料,3.5 Pro 在编程任务上一直没达到内部预期。谷歌 6 月底换了训练数据重新训练了一轮,结果不理想,于是 DeepMind 团队重构了模型的关键部分,这基本等于推倒重来。7 月 16 日延期消息被正式报道,谷歌母公司 Alphabet 股价当天应声下跌,直到我写这篇文章谷歌官方对于 3.5 Pro 的说法还是「正在与合作伙伴测试」。

而谷歌上一次发布 SOTA 级别的模型,已经是今年 2 月、将近半年前的 Gemini 3.1 Pro 了。

相较于不怎么惊艳的 Gemini 3.6 Flash,小杯的 Gemini 3.5 Flash-Lite 反而更有看点一些。3.5 Flash-Lite API 定价输入每百万 token 0.3 美元、输出 2.5 美元,输出速度能达到 350 token/s。又便宜又快。

性能方面就不用纠结过多了,和 3.6 Flash 差不多,3.5 Flash-Lite 的提升也相当有限。

下一代预训练都开始了,上一代 Pro 还在「与合作伙伴测试」。

谷歌,依旧死磕 Flash。

加载中...