预训练
使用来自网络、公开来源和授权数据集的 23.8 万亿个 token,重点涵盖代码、技术写作和 STEM。原始网络 token 中约 95% 被过滤掉。训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上进行,不到四周便完成,临近结束时的有效吞吐率达到 92.3%。
模型卡
Reflection AI 已发布的 Beam 构建与训练信息一览。数字来自官方公告和开发者文档;估算值会特别标注。
| 开发者 | Reflection AI (New York) |
|---|---|
| 发布日期 | 2026-10-05 |
| 模型类型 | 稀疏混合专家语言模型 |
| 参数总量 | 501B |
| 每个 token 激活的参数量 | 23B |
| 层数 | 52 |
| 注意力机制 | 局部注意力与全局注意力交替排列 |
| 上下文窗口(API 测试版) | 256K tokens |
| 中期训练达到的上下文长度 | 1M tokens |
| 最大输出长度(API) | 128K tokens |
| 知识截止日期 | 2026-06-30 |
| 模态 | 输入文本,输出文本 |
| 推理 | 始终开启,可设置推理强度 |
| API 功能 | 工具调用、结构化输出、流式传输 |
| 权重许可证 | Apache 2.0(承诺于 2026 年 10 月晚些时候开放权重) |
| API 模型 ID | Beam-501B-A23B |
在混合专家(Mixture-of-Experts)模型中,每一层都包含许多小型“专家”网络,路由器会为每个 token 选出其中几个。Beam 存储了 5010 亿个参数,但每个 token 只会经过其中约 230 亿个参数。
结果是:每个 token 的计算量接近 23B 稠密模型,因此 Beam 的服务成本更低,同时总容量仍然很大。代价在于内存。要运行模型,全部 501B 参数仍须驻留在 GPU 内存中。
Reflection 表示,其路由机制的负载平衡程度非常高:预训练结束时,负载最高的专家所承担的负载仅为平均值的 1.04×,因此所有专家都能得到利用。
使用来自网络、公开来源和授权数据集的 23.8 万亿个 token,重点涵盖代码、技术写作和 STEM。原始网络 token 中约 95% 被过滤掉。训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上进行,不到四周便完成,临近结束时的有效吞吐率达到 92.3%。
旨在为模型进行强化学习做准备的阶段:包含大量推理内容的长文档、代码仓库和长周期任务。Beam 的有效上下文长度就是在这一阶段扩展到了 100 万 tokens。
历时四周,在 10,500 块 GB300 GPU 上完成了超过 1 亿次 rollout,涵盖近 100 万个编码、智能体和 STEM 环境,以及约 13 亿个沙盒。Reflection 称,这是任何开放实验室规模最大的强化学习训练之一,并表示训练结束时各项分数仍在上升。
Reflection 使用同一个基础模型训练了一个独立的安全与对齐模型,并通过多教师在线策略蒸馏将其与强化学习模型合并。Reflection 表示,将在技术报告中公布安全评估结果,并开源其内部安全评测。
Beam 采用了长度惩罚训练机制,鼓励给出正确答案,同时避免生成不必要的 token。在 API 中,你可以选择推理强度:较低设置响应更快、使用的 token 更少;较高设置则会在难题上进行更长时间的思考。
Reflection 尚未公布硬件要求。以下是我们对仅加载权重所需内存的粗略估算(参数量 × 每个参数的字节数)。实际部署还需要为 KV 缓存和激活值预留额外内存。
| 精度 | 仅权重 | 硬件示例 |
|---|---|---|
| BF16 / FP16 | ≈ 1,002 GB | 8× 192 GB GPU(约 1.5 TB),或多节点集群 |
| FP8 | ≈ 501 GB | 8× 80 GB GPU 比较勉强;8× 141 GB 或更大显存则更宽裕 |
| INT4 / 4-bit | ≈ 251 GB | 至少需要 4× 80 GB GPU,长上下文则需要更多 |
这些是估算值,并非官方要求。模型卡发布后,我们会替换为 Reflection 的数据。