跳至内容
reflectionbeam

模型卡

Beam 规格

Reflection AI 已发布的 Beam 构建与训练信息一览。数字来自官方公告和开发者文档;估算值会特别标注。

概览

开发者Reflection AI (New York)
发布日期2026-10-05
模型类型稀疏混合专家语言模型
参数总量501B
每个 token 激活的参数量23B
层数52
注意力机制局部注意力与全局注意力交替排列
上下文窗口(API 测试版)256K tokens
中期训练达到的上下文长度1M tokens
最大输出长度(API)128K tokens
知识截止日期2026-06-30
模态输入文本,输出文本
推理始终开启,可设置推理强度
API 功能工具调用、结构化输出、流式传输
权重许可证Apache 2.0(承诺于 2026 年 10 月晚些时候开放权重)
API 模型 IDBeam-501B-A23B

总参数量 501B,活跃参数量为何只有 23B?

在混合专家(Mixture-of-Experts)模型中,每一层都包含许多小型“专家”网络,路由器会为每个 token 选出其中几个。Beam 存储了 5010 亿个参数,但每个 token 只会经过其中约 230 亿个参数。

结果是:每个 token 的计算量接近 23B 稠密模型,因此 Beam 的服务成本更低,同时总容量仍然很大。代价在于内存。要运行模型,全部 501B 参数仍须驻留在 GPU 内存中。

Reflection 表示,其路由机制的负载平衡程度非常高:预训练结束时,负载最高的专家所承担的负载仅为平均值的 1.04×,因此所有专家都能得到利用。

501B100%
23B4.6%

Beam 的训练过程

预训练

使用来自网络、公开来源和授权数据集的 23.8 万亿个 token,重点涵盖代码、技术写作和 STEM。原始网络 token 中约 95% 被过滤掉。训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上进行,不到四周便完成,临近结束时的有效吞吐率达到 92.3%。

中期训练

旨在为模型进行强化学习做准备的阶段:包含大量推理内容的长文档、代码仓库和长周期任务。Beam 的有效上下文长度就是在这一阶段扩展到了 100 万 tokens。

强化学习

历时四周,在 10,500 块 GB300 GPU 上完成了超过 1 亿次 rollout,涵盖近 100 万个编码、智能体和 STEM 环境,以及约 13 亿个沙盒。Reflection 称,这是任何开放实验室规模最大的强化学习训练之一,并表示训练结束时各项分数仍在上升。

安全与对齐

Reflection 使用同一个基础模型训练了一个独立的安全与对齐模型,并通过多教师在线策略蒸馏将其与强化学习模型合并。Reflection 表示,将在技术报告中公布安全评估结果,并开源其内部安全评测。

推理强度与 token 效率

Beam 采用了长度惩罚训练机制,鼓励给出正确答案,同时避免生成不必要的 token。在 API 中,你可以选择推理强度:较低设置响应更快、使用的 token 更少;较高设置则会在难题上进行更长时间的思考。

Beam 需要多少内存?

Reflection 尚未公布硬件要求。以下是我们对仅加载权重所需内存的粗略估算(参数量 × 每个参数的字节数)。实际部署还需要为 KV 缓存和激活值预留额外内存。

精度仅权重硬件示例
BF16 / FP16≈ 1,002 GB8× 192 GB GPU(约 1.5 TB),或多节点集群
FP8≈ 501 GB8× 80 GB GPU 比较勉强;8× 141 GB 或更大显存则更宽裕
INT4 / 4-bit≈ 251 GB至少需要 4× 80 GB GPU,长上下文则需要更多

这些是估算值,并非官方要求。模型卡发布后,我们会替换为 Reflection 的数据。