Qwen3.8-Max 正式版终于发布了,能不能打过 GPT 看这里
新浪财经头条
来源:MacTalk
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen 3.8 Max,每次国产模型的新发布都更加接近 Coding 领域的 SOTA。从 6 月开始,我感觉国内大模型明显开始在 Coding 和 Agent 领域加速了,我们和海外顶级 SOTA 的差距正在肉眼可见地缩小。
这是 3.8 Max 和 其他模型基准测试的对比图,进步明显。
老规矩先看参数,Qwen 3.8-Max 作为目前能力最强的 Qwen 模型,沿用 Qwen 3.5 的架构基础,总参数量扩展至 2.4 万亿、激活参数 950 亿,这次能力提升的重点明显是 Coding、Work(办公科研长任务)和 Agent 能力。
最重要的是,Qwen 3.8-Max 将成为首个开放权重的 Max 级模型,权重计划于发布后一周在 Hugging Face 和 ModelScope 上线,Qwen3.8-27B 也会开放权重。
看了下报价,大致是“旗舰能力、中端价格”的意思——输入和 GPT 的中端模型差不多,输出价显著低于所有同级别的 GPT 模型:输入 2 美元/百万 tokens,输出 6 美元/百万 tokens,隐式缓存 0.25 美元/百万 tokens。
1
无论是智谱 Kimi 还是千问,最近升级新模型的核心就提升编程能力,Coding Coding Coding,这个强调多少次都不过分。
这次 Qwen 3.8 Max 还提供了长时间的自我进化式开发,非常惊人。从一个空文件夹出发,在没有人工帮助的情况下,连续工作数天,通过执行结果和外部反馈不断修正计划,最终交付真实项目。
看一下技术报告里的三个案例:
1、自进化编程 Harness:Qwen3.8-Max 从零构建 oh-my-cli,把用户反馈、社区实践和模型自测统一到 issue、开发、测试、预览和日志反馈循环中。截至 2026 年 7 月 30 日,项目自主运行约 16 天,累计产生 265 次提交、127 个 PR 和 151 个 issue。
项目记录:qwen-code-dev-bot/oh-my-cli
https://github.com/qwen-code-dev-bot/oh-my-cli
2、复现论文并改进:模型在没有起始代码和现成流水线的条件下连续运行约 125 小时,编写约 7600 行代码,执行 1100 多步操作,完成 33 轮 GPU 训练。前 37 小时复现论文的六项主要结论;随后用约 88 小时提出并测试 18 种改进方法,最终在 AIME24 上比所复现的方法再提高 2.7 分。
相关论文:Unified Data Selection for LLM Reasoning
https://arxiv.org/abs/2605.22389
3、参加真实比赛:在一场有 526 支人类队伍参加的多模态电商对话意图识别挑战赛中,模型在 24 小时内独立完成方案设计和 45 次提交。官方称准确率从 0.60 提升到 0.853,超过 458 支队伍,约占参赛队伍的 87%。
2
除了 Coding,还有啥重要?Work Work Work,看看多少 Agent 提供了 Work 模式就知道了。这是 Qwen3.8-Max 在 QwenWork、Claude Code、Codex、龙虾和爱马仕 Agent 等不同 Harness 上的泛化表现。
Qwen 3.8-Max 可以在一小时内从数百份文件中标出 1284 条相关合规条款;一次生成数字银行 App 的八页高保真交互原型;基于供应资料设计 26 道菜并控制食材成本率;从图纸还原 30 层写字楼的抗震结构模型;把二维康复评估单做成三维交互演示;以及把每名球员约 8400 个攻防回合整理成战术画像和教练报告。
这叫 Work。
3
关于长程任务有一个好玩的案例,365 天电商模拟则考察持续经营:模型用 10 万元启动资金管理选品、议价、库存、定价和退货,并面对促销、供应链危机和欺诈商家。结果显示,Qwen 3.8-Max 最终现金为 416252 元,即 4.16 倍回报;比第二名 GLM 5.2 高 38%,比 Qwen 3.7-Max 高 152%。//这些数字来自模拟基准,不能直接等同于真实经营收益。
千问的多模态一直不错,这次模型增加了新能力:在任务进行中持续观察自己的中间产物,检查页面布局、物体方向、动画和交互结果,发现偏差后重新规划。
也就是说,视觉以前就是输入,现在变成了 Agent 任务里的一个反馈通道,可以边干边观察(视觉元素)。
看技术报告的案例,Qwen 3.8-Max 可以处理 200 多页财报和复杂 PDF,也可以把 100 多小时长视频组织成人物、事件、时间和场景构成的可检索记忆。模型还能把截图还原成前端项目、把户型图做成 Blender 三维效果、剪辑 Vlog,或生成交互应用。
这些会同时助力 Coding 和 多模态项目。
4
目前最新的 3.8-Max 已经可以使用了,打开 Qoder 就可以看到 Qwen 3.8 Max 上线的提示信息:
目前还有个优惠活动,我可以领取 2000 次调用,使用过程里会优先使用免费的调用次数:
另外,Qwen3.8-Max 已可通过千问 AI 平台调用。API 支持与 OpenAI chat completions/responses 兼容的协议,也提供与 Anthropic API 兼容的接口。reasoning_effort 可选 xhigh、medium、low,用来调节推理深度与成本;preserve_thinking 默认开启。
参考官方示例可以配置自己的 Claude Code、Codex 和龙虾、爱马仕等接入方式。
5
目前看,国产模型的长程任务、自主运行、反馈回路、跨 Harness 泛化和视觉自我检查等,能力越来越强了。我做一个谨慎的预测,预计到 2026 年的年底,对于重度开发者和 Vibe 用户来说,海外模型可能会成为辅助模型,国内的大模型将成为我们的主力工具。
模型用户没有忠诚度,大家会用脚投票的,拭目以待。
特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的30天内进行。