新浪科技

马斯克慌了,梁文锋突然发布新模型,不给人留活路

市场资讯 08.13 17:06

(来源:科技头版)

梁文锋要卷死在座的各位。

出品 | 科技头版    作者 | 刘峰

今天一早,各大AI测试榜单上突然出现一个新名字:DeepSeek-V4-Pro-0813

没有发布会,没有热搜,梁文锋甚至连个正经公告都没发,打磨了近两个月的DeepSeeV4Pro正式版就这么上线了。

这股不管不顾的狂劲儿,直接把马斯克干性情了12小时不到Grok 4.6直接上线,跑分、定价、接入Cursor的消息一股脑全放了出来,连一点缓冲都不带留的。

等开发者们测试后才反应过来两家大模型好像又把行业斩杀线往前提了提

更巧的是,阿里也赶在同一天,开放了刚发布10天的2.4万亿参数旗舰Qwen3.8的模型权重。

三家顶流厂商挤在同一天亮底牌,说不是故意的,你信吗?

猛攻世界第一,差距缩小到0.1分

DeepSeek。还是老样子,一个月黑风高的夜晚DeepSeek官网API文档悄然换版,模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。

自从R1模型收获前所未有的关注度之后,DeepSeek似乎很喜欢只用实力说话。

而后续一张DeepSeek官方群流出评测对比表,证实了这个说法

Terminal-Bench 2.1,一项衡量AI智能体在真实终端环境中完成复杂任务能力的测试V4 Pro正式版拿到87.9分。距离全球第一Anthropic Fable 588.0差距只剩0.1

而在其他两项测试中DeepSeek V4 Pro则是直接反杀了Fable 5。

分别是网络安全智能体测试CyberGym拿到83.3分,超过Fable 5的83.1自动化任务AutomationBench拿到31.8分,压过Fable 5的29.1分。

就连此前最薄弱的软件工程智能体DeepSWE,也从预览版的12.8分暴涨到62.7接近原来的4.9倍

而在带工具的“人类最后考试”HLE),DeepSeek也拿到60.0分,反超Opus 4.8的57.9分。

再看马斯克这边Grok 4.6的进攻同样猛烈。

综合智能指数上拿到61分,距离Fable 5的62分只差1分。CursorBench上拿到69.9%,超过GPT-5.6的67.2%。FrontierCode上拿到61.3%,压过GPT-5.6的60.6%。

到了更接近真实职场交付的知识工作中,Grok 4.6直接翻身反杀,在三项评测中全部拿下第一。专业法律任务Harvey LAB中拿到15.8%,Fable 5只有11.3%,GPT-5.6更是只有2.5%。

两家同时把矛头指向了同一个对手——Anthropic Fable 5。

但他们之间并非互相没有竞争,毕竟这场对决真正残酷的地方,不是性能,是价格。

官网最新数据显示,DeepSeek V4 Pro每百万输出Token收费0.87美元Grok 4.6要6美元。

GPT-5.6 Sol要30美元,Claude Opus 5要25美元,Fable 5要50美元

DeepSeek的价格约为Grok 4.6的七分之一GPT-5.6 Sol的三十五分之一

而对于一些只考虑用国外大模型的人来说,4.6的出现,也让Grok重新变得眉清目秀,性价比十足。

过去那种“性能价格和速度不能兼顾三角定律,正在被这两家公司联手拆掉。或者用网友很喜欢的一种说法,AI行业又开始缩圈了。

两个疯子,正在把智能推向过剩

事实上DeepSeek的发布外界早有预料,毕竟8月初V4 Flash刚把AI圈大搅一通,很难不让人对V4 Pro正式版有所预料

但马斯克突然的这一手,才是真令人意想不到。

梁文锋一直在算一笔很细的账。

V3开始,DeepSeek的论文便反复讨论MoE、MLA、低精度训练和推理效率。外界喜欢讲它用了多少芯片,DeepSeek更在意的是另一件事,同样一批芯片,能不能多训练一些,推理时能不能少花一点。

到了V4 Pro,这种偏执直接写在价格表上。每百万输出Token 0.87美元,约为Grok 4.6的七分之一、Fable 5的五十七分之一。

这已经超出了普通价格战的范围。

聊天机器人贵一点,用户未必有感觉。问十句话,用不了多少Token。

Agent会自己读文件、调用工具、改代码、跑测试,一项任务来回几十轮,甚至连续工作几个小时。调用量上去以后,每百万Token差几美元,月底就是两张完全不同的账单。

价格足够低,还会出现一个过去很少有人认真讨论的变化。

那些价值不高、步骤很多、以前不值得交给AI的杂活,也可以尝试自动化。整理一批旧文件,给几百段代码补测试,把散落的资料重新分类。这些任务单次省不了多少钱,数量却很大。

梁文锋赌的就是这个市场。

DeepSeek还提供Anthropic和OpenAI格式的接口。官方文档甚至直接教用户修改环境变量,让Claude Code调用V4 Pro。工具照旧,工作习惯照旧,里面那颗价格更高的模型可以先换下来试试。

而马斯克的想法则粗暴得多。

他先造出Colossus,把20万块H100接进同一个集群。此前xAI披露,Colossus I和II到2025年末已有超过100万块H100等效算力。

SpaceX收购xAI以后,算力、Grok、X和企业产品又被装进了一家公司。

Grok 4.6就是这套机器推出的新结果。它强调长周期Agent软件工程知识工作交互式项目。发布当天,模型直接进入Cursor和Grok Build。SpaceXAI还把它放进Business与Enterprise方案,连接企业的文档、邮箱和办公软件。

梁文锋想把一次调用变得足够便宜。马斯克想让一次调用持续得足够久,再让几亿用户和企业客户随时找到入口。

两家公司争的是同一批开发者,0.87美元和6美元也在争夺同一笔预算。竞争越直接,两种近乎极端的做法反而越容易把行业推向同一个结果。

智能开始从稀缺走向过剩。

过去,一个人使用一个AI,在聊天框里问问题。接下来,一个人可能同时开着几个Agent。有人让它们改代码,有人让它们查资料,还有人让它们盯着一项任务不断重试。模型不需要休息,只要价格和稳定性允许,调用便可以一直继续。

到那时,AI公司卖的依然是Token,用户购买的却是一段可以反复调用的工作能力。每百万Token多少钱会逐渐退到后面,一个任务最终花了多少钱、有没有按时完成,会成为更直接的标准。

当智能不再稀缺,很多今天算不过账的事情,才会有人认真考虑交给AI。

阿里也干了

但故事到这里还没完。

几乎是在同一时间,阿里巴巴开源8月3号刚发布的Qwen3.8-Max

2.4万亿参数的旗舰模型,说免费就免费,企业下载下来就能私有化部署,不用给阿里交一分授权费。

不过,该模型采用稀疏混合专家架构,单次激活约950亿参数,开放权重版的BF16文件接近4.9TB,普通电脑连存下它都费劲。阿里显然没有指望每个人都把模型搬回家。

它面对的是拥有GPU、工程团队和大量内部数据的企业。以前,这些公司想使用最强一档模型,往往只能通过外部API。Qwen第一次开放Max级权重以后,它们多了一个选择。模型可以放在自己的服务器里,数据也可以留在自己的环境中。

小团队继续调用云端API,大公司自行部署,普通用户直接使用产品。DeepSeek、SpaceXAI和阿里在十天之内,把三条路全铺了出来。

这也是硅谷高价模型接下来最难应付的地方。

单项评测领先0.1分,已经很难支撑几十倍的价差。企业还会继续比较任务完成率、返工次数和服务稳定性,但它们终于有资格追问一句,同样一项工作,为什么非要用最贵的模型。

DeepSeek V4 Pro打脚踝,Grok 4.6打腰部,Qwen3.8-Max打命根三家在同一夜,用不同的价格点位,从三个方向同时合围Anthropic和OpenAI等闭源模型的高价堡垒。

AI行业过去一直担心算力不够、模型不够强。现在,另一种问题已经出现。

当最顶级的智能开始降价、延长工作时间,甚至可以被企业搬回自己的服务器,人类会把这么多突然多出来的智能用到哪里

梁文锋和马斯克都没有给出答案。他们只是在同一个夜晚,把这个问题提前摆到了所有人面前。

加载中...