Zum Inhalt springen
reflectionbeam

Modellkarte

Beam-Spezifikationen

Alles, was Reflection AI über den Aufbau und das Training von Beam veröffentlicht hat. Die Zahlen stammen aus der offiziellen Ankündigung und den Entwicklerdokumenten; Schätzungen sind gekennzeichnet.

Auf einen Blick

EntwicklerReflection AI (New York)
Angekündigt2026-10-05
ModelltypSprachmodell mit sparsamer Expertenmischung
Gesamtzahl der Parameter501B
Aktive Parameter pro Token23B
Schichten52
AttentionAbwechselnde lokale und globale Attention
Kontextfenster (API-Beta)256K tokens
In der Mitte des Trainings erreichte Kontextlänge1M tokens
Maximale Ausgabe (API)128K tokens
Wissensstichtag2026-06-30
ModalitätTexteingabe, Textausgabe
ReasoningImmer aktiv, mit Einstellung für den Reasoning-Aufwand
API-FunktionenTool-Aufrufe, strukturierte Ausgaben, Streaming
Lizenz der GewichteApache 2.0 (Gewichte für einen späteren Zeitpunkt im Oktober 2026 angekündigt)
API-Modell-IDBeam-501B-A23B

Warum insgesamt 501B, aber nur 23B aktiv?

In einem Mixture-of-Experts-Modell enthält jede Schicht viele kleine „Experten“-Netzwerke, und ein Router wählt für jedes Token einige davon aus. Beam umfasst 501 Milliarden Parameter, aber jedes Token durchläuft nur etwa 23 Milliarden davon.

Das Ergebnis: Der Rechenaufwand pro Token liegt nahe an dem eines dichten 23B-Modells. Dadurch ist Beam günstiger im Betrieb, während die Gesamtkapazität groß bleibt. Der Haken ist der Speicherbedarf. Für den Betrieb des Modells müssen weiterhin alle 501B Parameter im GPU-Speicher liegen.

Reflection zufolge ist das Routing ungewöhnlich ausgewogen: Am Ende des Pretrainings trug der am stärksten ausgelastete Experte nur das 1,04-Fache der durchschnittlichen Last, sodass alle Experten zum Einsatz kommen.

501B100%
23B4.6%

So wurde Beam trainiert

Pretraining

23,8 Billionen Tokens aus dem Web, öffentlichen Quellen und lizenzierten Datensätzen, mit starkem Schwerpunkt auf Code, technischen Texten und MINT. Etwa 95 % der Tokens aus Rohdaten des Webs wurden herausgefiltert. Das Training lief auf 6,144 NVIDIA GB300 NVL72 GPUs in weniger als vier Wochen, gegen Ende mit einem Goodput von 92,3 %.

Midtraining

Eine Phase, in der das Modell auf bestärkendes Lernen vorbereitet werden soll: mit langen, reasoning-intensiven Dokumenten, Code-Repositories und Aufgaben mit langem Zeithorizont. In dieser Phase wurde Beams effektives Kontextfenster auf 1 Million Tokens erweitert.

Reinforcement Learning

Mehr als 100 Millionen Rollouts auf 10,500 GB300-GPUs über vier Wochen hinweg, verteilt auf fast eine Million Programmier-, agentische und MINT-Umgebungen sowie etwa 1.3 Milliarden Sandboxes. Reflection bezeichnet dies als einen der größten RL-Trainingsläufe eines offenen KI-Labors und erklärt, dass die Punktzahlen bis zum Ende weiter stiegen.

Sicherheit und Alignment

Ein separates Modell für Sicherheit und Alignment wurde mit derselben Basis trainiert und durch On-Policy-Destillation mit mehreren Lehrermodellen mit dem RL-Modell zusammengeführt. Reflection zufolge werden Sicherheitsevaluierungen im technischen Bericht veröffentlicht und die internen Sicherheitsevaluierungen als Open Source bereitgestellt.

Reasoning-Aufwand und Token-Effizienz

Beam wurde mit einer Längenstrafe trainiert, die richtige Antworten belohnt und unnötige Tokens verhindert. In der API wählen Sie den Reasoning-Aufwand: Niedrigere Einstellungen liefern schneller Antworten mit weniger Tokens, höhere Einstellungen lassen das Modell bei schwierigen Problemen länger nachdenken.

Wie viel Speicher benötigt Beam?

Reflection hat die Hardwareanforderungen noch nicht veröffentlicht. Dies sind unsere groben Schätzungen nur für die Gewichte (Parameter × Bytes pro Parameter). Für den tatsächlichen Betrieb wird zusätzlicher Speicher für den KV-Cache und die Aktivierungen benötigt.

GenauigkeitNur GewichteBeispielhardware
BF16 / FP16≈ 1.002 GB8× 192-GB-GPUs (etwa 1,5 TB) oder ein Cluster mit mehreren Knoten
FP8≈ 501 GB8× 80-GB-GPUs sind knapp; 8× 141 GB oder mehr bieten ausreichend Spielraum
INT4 / 4-bit≈ 251 GBMindestens 4× 80-GB-GPUs, bei langen Kontexten mehr

Schätzungen, keine offiziellen Anforderungen. Wir ersetzen sie durch die Angaben von Reflection, sobald die Model Card veröffentlicht wird.