新浪科技

Beam用230亿激活参数撑起5010亿的模型

A5创业网

关注

10月5日,纽约的Reflection AI发布了公司第一个开放权重模型,取名Beam。它是一个稀疏混合专家模型,总参数5010亿,每次推理只激活其中230亿。这个配比是它敢往外报低成本的底气——拿一小部分参数去干活,跟同等规模的稠密模型比,硬件门槛和推理开销都不在一个量级。模型定位是编程、推理和智能体任务,目前只处理文本。

训练数据里有两组数字值得记下来。预训练用了23.8万亿个token,跑在6144张GB300组成的NVL72集群上,四周内跑完,官方称有效算力占比达到92.3%——这个指标衡量的是有多少GPU时间真正用在了最终保留的模型上,而不是花在崩溃与重启里。之后的强化学习阶段另换了10500张GB300,生成超过1亿次rollout,环境池约100万个,覆盖编程、智能体和STEM任务,最大单次上下文25.6万token。

分数是官方自己报的。SWE-bench Verified拿到80.9%,Terminal-Bench2.1是80.1%,GPQA Diamond为90.5%,AIME2026达到97.8%,人类最后考试无工具版36.2%。Reflection也没把话说满:Kimi K3在原始能力上仍然领先,Beam的卖点是推理效率,官方称在高等推理基准上追平GLM5.2,用的推理算力只要对方的三到四分之一。这个对比基于活跃参数量乘生成token数的估算,不包含预填充与调度开销,属于近似计算,不是实测的推理成本。

需要提醒的是,现在还没有权重可以下载。官方开放的是早期访问候补名单,正式权重、技术报告、模型卡和开发者工具都承诺本月内放出,许可证是Apache2.0。除了Reflection自己,眼下还没有人真正跑过这个模型,所有分数都缺第三方复现。它同时在与美国的标准与创新中心、英国的人工智能安全研究所合作评估,并计划把内部使用的安全评测方法开源出来。

这件事的信号意义在路线选择上。过去两年开放权重这条线里,中国厂商的模型一直占着性能和成本两头的位置,Reflection挑的是另一个切入点——不比谁的绝对上限更高,比同样的分数要用掉多少算力。对自建推理的中小团队和个人来说,能不能在手里的显存上跑得起来,常常比榜单上多几分更实在。真正的检验要等权重放出来之后,社区实测和第三方评测那时才会给出答案。

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

加载中...