Ga naar de inhoud
reflectionbeam

Modelkaart

Beam-specificaties

Alles wat Reflection AI heeft gepubliceerd over de bouw en training van Beam. De cijfers komen uit de officiële aankondiging en de documentatie voor ontwikkelaars; schattingen zijn gemarkeerd.

In één oogopslag

OntwikkelaarReflection AI (New York)
Aangekondigd2026-10-05
ModeltypeTaalmodel met een schaarse mixture of experts
Totaal aantal parameters501B
Actieve parameters per token23B
Lagen52
AandachtAfwisselende lokale en globale aandacht
Contextvenster (API-bèta)256K tokens
Tijdens de middentraining bereikte contextlengte1M tokens
Maximale uitvoer (API)128K tokens
Kennisgrens2026-06-30
ModaliteitTekst erin, tekst eruit
RedenerenAltijd actief, met een instelling voor de redeneerinspanning
API-functiesToolaanroepen, gestructureerde uitvoer, streaming
Licentie voor gewichtenApache 2.0 (gewichten toegezegd voor later in oktober 2026)
API-model-IDBeam-501B-A23B

Waarom in totaal 501B, maar slechts 23B actief?

In een Mixture-of-Experts-model bevat elke laag veel kleine ‘expert’-netwerken en kiest een router er voor elk token een paar uit. Beam bevat 501 miljard parameters, maar elk token doorloopt er slechts ongeveer 23 miljard van.

Het resultaat: de berekeningen per token zijn vergelijkbaar met die van een dicht model van 23B, waardoor Beam goedkoper te serveren is, terwijl de totale capaciteit groot blijft. Het nadeel is het geheugenverbruik. Om het model te serveren, moeten alle 501B parameters in het GPU-geheugen staan.

Reflection zegt dat de routering uitzonderlijk goed in balans is: aan het einde van de voortraining had de drukst belaste expert slechts 1,04× de gemiddelde belasting, waardoor alle experts worden benut.

501B100%
23B4.6%

Hoe Beam is getraind

Voortraining

23,8 biljoen tokens uit het web, openbare bronnen en datasets met licentie, met veel nadruk op code, technisch schrijven en STEM. Ongeveer 95% van de ruwe webtokens werd eruit gefilterd. Uitgevoerd op 6.144 NVIDIA GB300 NVL72-GPU's in minder dan vier weken, met tegen het einde een goodput van 92,3%.

Tussentraining

Een fase die is ontworpen om het model voor te bereiden op reinforcement learning: documenten met veel redeneerstappen, coderepositories en taken met een lange tijdshorizon. In deze fase werd de effectieve context van Beam uitgebreid tot 1 miljoen tokens.

Reinforcement learning

Meer dan 100 miljoen rollouts op 10.500 GB300-GPU's gedurende vier weken, verspreid over bijna één miljoen programmeer-, agentische en STEM-omgevingen en ongeveer 1,3 miljard sandboxomgevingen. Reflection noemt dit een van de grootste RL-runs ooit door een open lab en zegt dat de scores nog steeds stegen toen de run eindigde.

Veiligheid en afstemming

Een afzonderlijk model voor veiligheid en afstemming werd getraind op dezelfde basis en via multi-teacher on-policy distillation samengevoegd met het RL-model. Reflection zegt veiligheidsevaluaties in het technische rapport te publiceren en de interne veiligheidsevaluaties als opensource beschikbaar te maken.

Redeneerinspanning en tokenefficiëntie

Beam is getraind met een lengtepenalty die juiste antwoorden beloont en onnodige tokens ontmoedigt. In de API kies je een redeneerinspanning: lagere instellingen antwoorden sneller met minder tokens, hogere instellingen denken langer na over moeilijke problemen.

Hoeveel geheugen heeft Beam nodig?

Reflection heeft de hardwarevereisten nog niet gepubliceerd. Dit zijn onze ruwe schattingen voor alleen de gewichten (parameters × bytes per parameter). Voor echte implementaties is extra geheugen nodig voor de KV-cache en activaties.

PrecisieAlleen gewichtenVoorbeeldhardware
BF16 / FP16≈ 1.002 GB8× 192 GB GPU's (ongeveer 1,5 TB) of een cluster met meerdere nodes
FP8≈ 501 GB8× 80 GB GPU's is krap; 8× 141 GB of meer biedt voldoende ruimte
INT4 / 4-bit≈ 251 GBMinimaal 4× 80 GB-GPU's, meer voor lange contexten

Schattingen, geen officiële vereisten. We vervangen ze door de cijfers van Reflection zodra de modelkaart verschijnt.