马斯克带着Grok 4.5杀回AI第一梯队:性能逼近Claude,成本打到更低
创业邦
编辑丨小龙
在过去一年,大模型竞争越来越像一场没有终点的军备竞赛。
OpenAI、Anthropic、Google不断刷新模型能力边界,Claude凭借代码能力在开发者市场建立优势,GPT系列则持续向企业应用扩张。
相比之下,马斯克旗下xAI推出的Grok,逐渐淡出了主流模型竞争。
这并不是马斯克最初设想的结果。
2023年成立xAI时,马斯克曾希望打造一家能够挑战OpenAI的AI公司。但过去一年,xAI经历了团队调整、战略变化,Grok系列也没有持续保持此前的关注度。
7月9日,马斯克发布Grok 4.5。
这一次,他没有强调“全球最强模型”,也没有试图用一个更高的Benchmark成绩证明自己。
Grok 4.5给出的卖点是:接近Claude Opus级别的能力,更快的速度、更低的Token消耗,以及更低的使用成本。
马斯克想证明的,不是Grok拥有最高的模型智商,而是在大量真实任务中,它可能是更划算的选择。
这背后反映的,是大模型竞争逻辑正在变化。
过去两年,行业关注的是模型能力上限。
谁的参数更多,谁的测试成绩更高,谁就更容易获得关注。
但随着AI开始进入企业工作流,企业面对的问题正在从“模型能不能做到”转向“完成任务需要多少成本”。
Grok 4.5试图回答的,正是这个问题。
收购Cursor后的第一张牌
Grok 4.5重新进入前沿模型竞争
对于xAI而言,Grok 4.5并不仅是一款新模型。
更重要的是,这是马斯克AI版图调整后的第一张牌。
此前,马斯克曾公开承认,xAI在编程能力方面落后于竞争对手,并推动团队进行调整。
这并不难理解。
在当前AI商业化进程中,软件开发已成为最成熟、最落地的应用场景之一。一方面,开发者乐于为切实提升编码效率的工具付费;另一方面,企业也愿意为能够有效降低研发成本的产品买单。正因如此,代码能力正逐渐演变为大模型竞争的重要入口,谁能在这一环节建立起优势,谁就更容易获得开发者的信任与黏性。而Cursor的出现,恰好弥补了xAI此前在代码场景侧的短板。
与传统模型主要依赖公开代码仓库进行训练不同,Cursor所拥有的,是大量来自真实软件开发过程的行为数据与上下文信息,这种过程性的、动态的数据积累,恰恰构成了更具竞争力的壁垒,也让xAI在通往AGI的道路上多了一块坚实的落脚点。
模型可以通过代码学习,某个函数应该如何编写。但真正复杂的软件工程,并不只是生成一段代码,而是包含开发者如何理解庞大的代码库、定位问题、调用工具、反复修改验证,以及最终与AI协作完成一个完整任务的全过程。
这些经验,并不会简单存在于公开代码中。
Cursor的数据价值,就在于它记录了真实开发过程。
据Cursor透露,Grok 4.5训练过程中引入了数万亿Token规模的Cursor数据。这些数据不仅包含代码,还包括开发者与代码库、工具以及AI Agent之间的交互记录。
换句话说,Grok 4.5学习的不只是“如何写代码”,而是在学习“工程师如何完成软件开发”。
这也是为什么Grok 4.5此次重点提升的是Coding和Agent能力。它不再只是一个代码补全工具,而是在尝试成为能够处理复杂软件任务的AI Agent。
从模型本身来看,Grok 4.5已经进入前沿模型竞争区间。
这是一款基于MoE架构的大模型,参数规模约1.5万亿,支持最高50万上下文窗口,训练过程中使用了xAI的大规模计算资源,包括数万块英伟达GB300 GPU。
但相比单纯扩大参数规模,Grok 4.5更大的变化来自训练方式
xAI和Cursor对训练数据进行了去重、质量评分和领域筛选,提高数据质量密度。
强化学习阶段,则重点围绕多步骤软件工程和技术任务展开。
这类任务与传统Benchmark不同。
模型需要理解目标、拆解问题、调用工具、执行任务,并根据结果不断调整,这更接近未来Agent真正进入工作场景的方式。因此,Grok 4.5的定位也正在发生变化:过去,Grok更多被看作一个带有社交属性的聊天机器人;而如今,它正逐渐向企业生产力工具靠近,除了软件工程场景外,还开始覆盖金融、法律等知识工作领域,并进入Excel、PowerPoint、Word等办公任务。
从这个角度看,收购Cursor并不是简单增加一个产品入口,而是帮助xAI获得了一套进入企业市场的能力。
不再争“最强模型”
马斯克押注AI时代的新指标
如果只看模型能力,Grok 4.5并不是一次彻底颠覆。
它没有宣布全面超过GPT或者Claude。
甚至马斯克自己也承认,在一些极高难度任务中,部分旗舰模型仍然具备优势。
但这一次,他关注的是另一个指标:成本。
发布Grok 4.5后,马斯克反复强调,能力、更快速度和更低成本三者结合,才是模型真正的竞争力。
这也是AI行业正在发生的一种变化。
过去,大模型公司喜欢展示Benchmark成绩。
但对于企业来说,排行榜第一并不一定意味着商业价值最高。
企业购买的不是模型分数,而是任务结果。
一个模型如果完成同样工作,需要更少Token、更少调用、更少等待时间,它创造的价值可能更高。
因此,一个新的评价指标正在受到关注:Cost per Task。
即:完成一个真实任务,需要多少成本。
Grok 4.5正是围绕这一指标展开竞争。
从API价格来看,Grok 4.5输入价格为每百万Token 2美元,输出价格为每百万Token 6美元,明显低于部分旗舰模型。
但更重要的是,它降低成本并不只是因为价格低。
而是因为完成同样任务时,需要消耗更少Token。
在Agent时代,模型成本并不只是一次调用的价格,而是完成一个任务的综合成本,包括输入和输出Token消耗、工具调用次数、失败后的重复执行,以及最终仍需要人工介入修正的成本。
一个模型如果需要不断生成长答案、反复修改,最终账单可能远高于表面价格。
Grok 4.5试图解决的,就是效率问题。
在SWE Bench Pro测试中,Grok 4.5平均输出约15954个Token,而Claude Opus 4.8 Max完成类似任务平均需要约67020个Token,前者消耗量约为后者四分之一。
主要模型SWE Bench Pro任务token消耗
这意味着,Token效率正在成为模型竞争的新维度。
Artificial Analysis的数据也显示,Grok 4.5在真实知识工作任务测试中进入前列,同时单任务成本明显低于多个排名靠前的模型。
其中,一个GDPval任务成本约0.49美元。
这正是马斯克想强调的:未来AI竞争,可能不只是比谁拥有最强的大脑。
而是比谁能让智能以更低成本被大量使用。
当模型能力差距缩小时,企业未必需要永远追求最高能力。
如果一个模型能够覆盖90%的工作场景,却只需要十分之一成本,它可能更容易成为企业默认选择。
Grok 4.5押注的,就是这个市场。
从模型到基础设施
马斯克正在重建AI版图
Grok 4.5真正值得关注的地方,并不只是模型本身。它背后体现的是马斯克一直以来的产业逻辑:通过垂直整合降低系统成本。
过去,无论是特斯拉还是SpaceX,马斯克都没有选择只做单一环节。
特斯拉同时掌握电池、电驱、软件和制造体系。
SpaceX同时掌握火箭研发、制造和发射能力。
进入AI领域后,他也在尝试建立类似体系。
Grok 4.5背后,已经形成了一条AI链路。
上游,是算力。
xAI建设了Colossus超级计算中心,并持续扩大GPU规模,为模型训练提供基础设施。
中间,是数据。
除了互联网数据,xAI拥有X平台的信息流,同时通过Cursor获得大量真实开发过程数据。
从算力、数据到应用的完整闭环,由Cursor作为开发者入口、Grok Build覆盖创作与办公场景、特斯拉与SpaceX内部工程团队提供真实使用环境,最终在下游应用中得以落地实现。
这种模式与OpenAI、Anthropic有所不同。后两者更多依靠模型能力和生态合作扩大影响力。
而马斯克希望控制更多底层资源,通过系统优化降低成本。
不过,Grok 4.5的发布,也并不意味着xAI已经赢得竞争。
事实上,这款模型背后有着强烈的压力。
过去一年,Grok系列曾因生成不当内容引发争议,xAI团队也经历调整。
与此同时,AI编程市场竞争越来越激烈。Anthropic凭借Claude系列建立优势,Cursor也面临来自其他AI编程工具的竞争。
因此,对于xAI来说,Grok 4.5不仅是一款产品升级,更是一次重新证明自己的机会。
它需要向市场证明:xAI不仅可以训练模型,也能够把模型变成真正有商业价值的产品。
目前来看,Grok 4.5释放出的信号很明确:AI竞争正在从“智能竞赛”进入“工程竞赛”。
未来的竞争,不只是看谁能训练出更大的模型。还要看谁能让模型运行得更快、成本更低,并真正进入企业工作流程。
Grok 4.5是否能够改变AI市场格局,现在还没有答案。
但至少这一次,马斯克重新把Grok带回了牌桌。
而新的竞争规则正在形成,未来几年,AI行业争夺的不一定只是“谁拥有最强的大脑”。
更重要的是,谁能让这个大脑,以最低成本服务更多真实需求。