Przejdź do treści
reflectionbeam

Karta modelu

Specyfikacja Beam

Wszystko, co Reflection AI opublikowało na temat budowy i trenowania Beam. Dane pochodzą z oficjalnego ogłoszenia i dokumentacji dla deweloperów; szacunki są oznaczone.

W skrócie

DeweloperReflection AI (New York)
Ogłoszono2026-10-05
Typ modeluRzadki model językowy typu Mixture-of-Experts
Łączna liczba parametrów501B
Aktywne parametry na token23B
Warstwy52
Mechanizm uwagiNaprzemienne lokalne i globalne mechanizmy uwagi
Okno kontekstu (beta API)256K tokens
Długość kontekstu osiągnięta w środkowej fazie treningu1M tokens
Maksymalna długość odpowiedzi (API)128K tokens
Granica wiedzy2026-06-30
ModalnośćTekst na wejściu, tekst na wyjściu
RozumowanieZawsze włączone, z ustawieniem wysiłku rozumowania
Funkcje APIWywoływanie narzędzi, ustrukturyzowane dane wyjściowe, przesyłanie strumieniowe
Licencja wagApache 2.0 (wagi mają zostać udostępnione później, w październiku 2026 r.)
Identyfikator modelu APIBeam-501B-A23B

Dlaczego łącznie 501B, ale aktywne 23B?

W modelu typu Mixture-of-Experts każda warstwa zawiera wiele małych sieci „ekspertów”, a router wybiera kilka z nich dla każdego tokenu. Beam ma 501 miliardów parametrów, ale każdy token przechodzi tylko przez około 23 miliardy z nich.

W rezultacie obliczenia na token są zbliżone do obliczeń dla gęstego modelu 23B, dzięki czemu Beam jest tańszy w obsłudze, a jednocześnie zachowuje dużą całkowitą pojemność. Minusem jest pamięć. Wszystkie 501B parametrów nadal musi znajdować się w pamięci GPU, aby można było obsługiwać model.

Reflection twierdzi, że routing jest wyjątkowo równomierny: pod koniec pretreningu najbardziej obciążony ekspert obsługiwał zaledwie 1.04× średniego obciążenia, więc wykorzystywani są wszyscy eksperci.

501B100%
23B4.6%

Jak trenowano Beam

Pretrening

23.8 biliona tokenów z internetu, źródeł publicznych i licencjonowanych zbiorów danych, ze szczególnym naciskiem na kod, teksty techniczne i STEM. Odfiltrowano około 95% tokenów z surowych danych internetowych. Trening przeprowadzono na 6,144 procesorach graficznych NVIDIA GB300 NVL72 w niecałe cztery tygodnie, osiągając pod koniec 92.3% goodput.

Trening pośredni

Etap przygotowujący model do uczenia przez wzmacnianie: długie dokumenty bogate w rozumowanie, repozytoria kodu i zadania o długim horyzoncie. Na tym etapie rozszerzono efektywne okno kontekstu Beam do 1 miliona tokenów.

Uczenie przez wzmacnianie

Ponad 100 milionów trajektorii na 10,500 procesorach GB300 przez cztery tygodnie, w prawie milionie środowisk związanych z programowaniem, działaniem agentów i STEM oraz w około 1.3 miliarda piaskownic. Reflection określa ten trening jako jeden z największych przebiegów RL przeprowadzonych przez dowolne niezależne laboratorium i twierdzi, że wyniki nadal rosły w chwili jego zakończenia.

Bezpieczeństwo i dostrajanie do preferencji

Osobny model bezpieczeństwa i dostrajania do preferencji wytrenowano na tej samej bazie, a następnie połączono z modelem RL za pomocą destylacji on-policy z udziałem wielu nauczycieli. Reflection zapowiada publikację ocen bezpieczeństwa w raporcie technicznym oraz udostępnienie wewnętrznych ewaluacji bezpieczeństwa na otwartej licencji.

Wysiłek rozumowania a efektywność wykorzystania tokenów

Beam trenowano z karą za długość, która nagradza poprawne odpowiedzi i zniechęca do używania zbędnych tokenów. W API wybierasz poziom wysiłku rozumowania: niższe ustawienia pozwalają szybciej uzyskać odpowiedź przy użyciu mniejszej liczby tokenów, a wyższe wydłużają namysł nad trudnymi problemami.

Ile pamięci potrzeba dla Beam?

Reflection nie opublikowało jeszcze wymagań sprzętowych. To nasze przybliżone szacunki dotyczące samych wag (parametry × bajty na parametr). Rzeczywiste wdrożenia wymagają dodatkowej pamięci na pamięć podręczną KV i aktywacje.

PrecyzjaTylko wagiPrzykładowy sprzęt
BF16 / FP16≈ 1002 GB8× procesorów graficznych o pojemności 192 GB (około 1.5 TB) lub klaster złożony z wielu węzłów
FP8≈ 501 GB8× procesorów graficznych o pojemności 80 GB to za mało; 8× 141 GB lub więcej zapewnia odpowiedni zapas
INT4 / 4-bit≈ 251 GBMinimum 4× GPU z 80 GB pamięci, więcej przy długim kontekście

Szacunki, nieoficjalne wymagania. Zastąpimy je danymi Reflection, gdy ukaże się karta modelu.