Lumaktaw sa nilalaman
reflectionbeam

Model card

Mga detalye ng Beam

Lahat ng inilathala ng Reflection AI tungkol sa pagkakabuo at pagsasanay sa Beam. Mula sa opisyal na anunsyo at dokumentasyon para sa developer ang mga numero; may label ang mga pagtatantya.

Sa isang sulyap

DeveloperReflection AI (New York)
Inanunsyo2026-10-05
Uri ng modeloSparse na language model na Mixture-of-Experts
Kabuuang mga parameter501B
Mga aktibong parameter sa bawat token23B
Mga layer52
AttentionSalit-salitang lokal at pandaigdigang attention
Haba ng konteksto (API beta)256K tokens
Haba ng kontekstong naabot sa kalagitnaan ng pagsasanay1M tokens
Pinakamaraming output (API)128K tokens
Hanggang saan ang kaalaman2026-06-30
ModalidadTeksto ang input, teksto ang output
PangangatwiranPalaging aktibo, may setting para sa antas ng pangangatwiran
Mga feature ng APIPagtawag ng tool, mga structured output, streaming
Lisensya ng mga timbangApache 2.0 (ipinangakong ilalabas ang mga weight sa bandang huli ng Oktubre 2026)
Model ID ng APIBeam-501B-A23B

Bakit 501B ang kabuuan pero 23B lang ang aktibo?

Sa isang Mixture-of-Experts model, maraming maliliit na network ng “eksperto” ang nasa bawat layer, at pumipili ang router ng ilan sa mga ito para sa bawat token. May 501 bilyong parameter ang Beam, pero humigit-kumulang 23 bilyon lang sa mga ito ang dinaraanan ng bawat token.

Ang resulta: halos katulad ng sa isang 23B dense model ang compute para sa bawat token, kaya mas mura ang pagseserbisyo sa Beam habang nananatiling malaki ang kabuuang kapasidad nito. Ang kapalit nito ay memory. Kailangan pa ring nasa GPU memory ang lahat ng 501B parameter para mapatakbo ang model.

Ayon sa Reflection, pambihirang balanse ang routing nito: sa pagtatapos ng pretraining, 1.04× lang ng karaniwang load ang pasan ng pinakaabalang eksperto, kaya nagagamit ang lahat ng eksperto.

501B100%
23B4.6%

Paano sinanay ang Beam

Pretraining

23.8 trilyong token mula sa web, mga pampublikong source at lisensyadong dataset, na may malaking pokus sa code, teknikal na pagsulat at STEM. Nasala palabas ang humigit-kumulang 95% ng mga raw web token. Pinatakbo sa 6,144 NVIDIA GB300 NVL72 GPU sa loob ng wala pang apat na linggo, na may 92.3% goodput nang papalapit na sa pagtatapos.

Midtraining

Yugtong idinisenyo para ihanda ang model para sa reinforcement learning: mahahabang dokumentong hitik sa pangangatwiran, mga repository ng code at mga gawaing may mahabang hanay ng hakbang. Dito pinalawak ang epektibong context ng Beam sa 1 milyong token.

Reinforcement learning

Mahigit 100 milyong rollout sa 10,500 GB300 GPU sa loob ng apat na linggo, sa halos isang milyong coding, agentic at STEM environment at humigit-kumulang 1.3 bilyong sandbox. Tinatawag ito ng Reflection na isa sa pinakamalalaking RL run ng anumang open lab, at sinasabing patuloy pang tumataas ang mga score nang matapos ito.

Kaligtasan at alignment

Sinanay mula sa parehong base ang hiwalay na safety-and-alignment model at pinagsama ito sa RL model sa pamamagitan ng multi-teacher on-policy distillation. Ayon sa Reflection, ilalathala nito ang mga safety evaluation sa teknikal na ulat at gagawing open source ang mga panloob nitong safety eval.

Antas ng pangangatwiran at kahusayan sa paggamit ng token

Sinanay ang Beam gamit ang length penalty na nagbibigay-gantimpala sa mga tamang sagot at pumipigil sa paggamit ng mga hindi kailangang token. Sa API, pipili ka ng antas ng pangangatwiran: mas mabilis sumagot at mas kaunting token ang ginagamit sa mabababang setting, samantalang mas matagal mag-isip sa mahihirap na problema ang matataas na setting.

Gaano karaming memory ang kailangan ng Beam?

Hindi pa inilalathala ng Reflection ang mga kinakailangan sa hardware. Mga tantiya lang namin ang mga ito para sa mga weight lamang (mga parameter × byte bawat parameter). Nangangailangan ng dagdag na memory ang mga aktuwal na deployment para sa KV cache at mga activation.

PrecisionMga weight lamangHalimbawang hardware
BF16 / FP16≈ 1,002 GB8× 192 GB GPU (humigit-kumulang 1.5 TB) o cluster na may maraming node
FP8≈ 501 GBKapos ang 8× 80 GB GPU; sapat na ang 8× 141 GB o mas malaki
INT4 / 4-bit≈ 251 GBHindi bababa sa 4× 80 GB na GPU; mas marami para sa mahahabang konteksto

Mga pagtataya ito, hindi opisyal na kinakailangan. Papalitan namin ang mga ito ng mga numero ng Reflection kapag inilabas na ang model card.