コンテンツへスキップ
reflectionbeam

モデルカード

Beamの仕様

Beamの構築方法と学習方法についてReflection AIが公開した情報をまとめました。数値は公式発表と開発者向けドキュメントに基づいています。推定値にはその旨を記載しています。

概要

開発元Reflection AI (New York)
発表日2026-10-05
モデルの種類スパースなMixture-of-Experts言語モデル
総パラメータ数501B
トークンあたりのアクティブパラメータ数23B
レイヤー数52
アテンション方式ローカルアテンションとグローバルアテンションを交互に使用
コンテキストウィンドウ(APIベータ版)256K tokens
中間学習で到達したコンテキスト長1M tokens
最大出力(API)128K tokens
知識のカットオフ2026-06-30
モダリティテキスト入力、テキスト出力
推論常時利用可能、推論強度を設定可能
API機能ツール呼び出し、構造化出力、ストリーミング
重みのライセンスApache 2.0(重みは2026年10月後半に公開予定)
APIモデルIDBeam-501B-A23B

合計501Bなのに、アクティブなのは23Bなのはなぜ?

Mixture-of-Expertsモデルでは、各層に多数の小さな「エキスパート」ネットワークがあり、ルーターがトークンごとにそのうちいくつかを選びます。Beamは5010億個のパラメータを保持していますが、各トークンが通過するのはそのうち約230億個だけです。

その結果、トークンあたりの計算量は23Bの密なモデルに近くなり、Beamの提供コストを抑えられます。一方で、総容量は大きいままです。ただし、メモリが課題です。モデルを提供するには、501Bの全パラメータをGPUメモリに載せる必要があります。

Reflectionによると、Beamのルーティングは非常に均衡しています。事前学習の終了時点で、最も負荷の高いエキスパートの負荷は平均のわずか1.04×で、すべてのエキスパートが活用されます。

501B100%
23B4.6%

Beamのトレーニング方法

事前学習

ウェブ上の情報、公的な情報源、ライセンス済みデータセットから集めた23.8兆トークンを使用し、コード、技術文書、STEM分野を重視しています。生のウェブトークンの約95%は除外されました。NVIDIA GB300 NVL72 GPU 6,144基で4週間足らずで学習を実行し、終盤のグッドプットは92.3%に達しました。

中間学習

モデルを強化学習に備えさせるための段階です。長い推論重視の文書、コードリポジトリ、長期的なタスクを用います。この段階でBeamの実効コンテキストは100万トークンに拡張されました。

強化学習

4週間にわたり、GB300 GPU 10,500基で1億回を超えるロールアウトを実施しました。約100万のコーディング、エージェント型、STEM環境と、約13億のサンドボックスにまたがる規模です。Reflectionは、オープンラボによるRL実行として最大級のものの一つだと述べ、終了時にもスコアは上昇を続けていたとしています。

安全性とアラインメント

同じベースモデルから安全性とアラインメントに特化した別のモデルをトレーニングし、マルチティーチャーのオンポリシー蒸留を通じてRLモデルと統合しました。Reflectionは、技術レポートで安全性評価を公開し、社内の安全性評価をオープンソース化すると述べています。

推論強度とトークン効率

Beamは、正解に報酬を与え、不要なトークンを抑える長さペナルティを用いてトレーニングされました。APIでは推論強度を選択できます。低い設定では少ないトークンで速く回答し、高い設定では難しい問題についてより長く考えます。

Beamにはどれくらいのメモリが必要?

Reflectionはまだハードウェア要件を公開していません。以下は重みだけに必要なメモリの概算です(パラメータ数 × 1パラメータあたりのバイト数)。実際のデプロイでは、KVキャッシュとアクティベーション用に追加のメモリが必要です。

精度重みのみハードウェアの例
BF16 / FP16≈ 1,002 GB192 GB GPUを8台(約1.5 TB)、またはマルチノードクラスター
FP8≈ 501 GB80 GB GPUを8台では余裕がありません。141 GB以上のGPUを8台なら十分です
INT4 / 4-bit≈ 251 GB最低でも80 GB GPUが4基、長いコンテキストではさらに必要

公式要件ではなく推定値です。モデルカードが公開されたら、Reflectionの数値に差し替えます。