Vai al contenuto
reflectionbeam

Scheda del modello

Specifiche di Beam

Tutto ciò che Reflection AI ha pubblicato su come Beam è stato realizzato e addestrato. I numeri provengono dall'annuncio ufficiale e dalla documentazione per sviluppatori; le stime sono indicate come tali.

In breve

SviluppatoreReflection AI (New York)
Annunciato2026-10-05
Tipo di modelloModello linguistico Mixture-of-Experts sparso
Parametri totali501B
Parametri attivi per token23B
Livelli52
AttenzioneAttenzione locale e globale alternata
Finestra di contesto (beta API)256K tokens
Lunghezza del contesto raggiunta a metà addestramento1M tokens
Output massimo (API)128K tokens
Data limite delle conoscenze2026-06-30
ModalitàTesto in ingresso, testo in uscita
RagionamentoSempre attivo, con un'impostazione dello sforzo di ragionamento
Funzionalità APIChiamata degli strumenti, output strutturati, streaming
Licenza dei pesiApache 2.0 (pesi promessi per più avanti nell'ottobre 2026)
ID del modello APIBeam-501B-A23B

Perché 501B totali ma solo 23B attivi?

In un modello Mixture-of-Experts, ogni layer contiene molte piccole reti «expert» e un router ne seleziona alcune per ogni token. Beam memorizza 501 miliardi di parametri, ma ogni token ne attraversa solo circa 23 miliardi.

Il risultato: il calcolo per token è simile a quello di un modello denso da 23B, il che rende Beam più economico da servire, mentre la capacità totale resta elevata. Il compromesso è la memoria: per servire il modello, tutti i 501B parametri devono comunque risiedere nella memoria delle GPU.

Reflection afferma che il suo sistema di routing è insolitamente equilibrato: al termine del preaddestramento, l'expert più carico gestiva solo 1.04× il carico medio, quindi tutti gli expert vengono utilizzati.

501B100%
23B4.6%

Come è stato addestrato Beam

Preaddestramento

23.8 trilioni di token provenienti dal web, da fonti pubbliche e da dataset su licenza, con una forte attenzione a codice, scrittura tecnica e STEM. È stato filtrato circa il 95% dei token web grezzi. L'addestramento è stato eseguito su 6,144 GPU NVIDIA GB300 NVL72 in meno di quattro settimane, con un goodput del 92.3% verso la fine.

Addestramento intermedio

Una fase progettata per preparare il modello all'apprendimento per rinforzo: documenti lunghi e ricchi di ragionamenti, repository di codice e attività a lungo termine. In questa fase il contesto effettivo di Beam è stato esteso a 1 milione di token.

Apprendimento per rinforzo

Oltre 100 milioni di rollout su 10,500 GPU GB300 nell'arco di quattro settimane, in quasi un milione di ambienti di programmazione, agentici e STEM e circa 1.3 miliardi di sandbox. Reflection lo definisce uno dei più grandi cicli di RL mai eseguiti da un laboratorio open e afferma che i punteggi continuavano a salire quando si è concluso.

Sicurezza e allineamento

Un modello separato per sicurezza e allineamento è stato addestrato a partire dalla stessa base e unito al modello RL tramite distillazione on-policy multi-teacher. Reflection afferma che pubblicherà le valutazioni di sicurezza nel rapporto tecnico e renderà open source le proprie valutazioni interne di sicurezza.

Sforzo di ragionamento ed efficienza nell'uso dei token

Beam è stato addestrato con una penalità sulla lunghezza che premia le risposte corrette e scoraggia l'uso di token non necessari. Nell'API puoi scegliere uno sforzo di ragionamento: le impostazioni più basse forniscono risposte più rapide con meno token, quelle più alte dedicano più tempo ai problemi difficili.

Quanta memoria richiede Beam?

Reflection non ha ancora pubblicato i requisiti hardware. Queste sono le nostre stime approssimative per i soli pesi (parametri × byte per parametro). Le implementazioni reali richiedono memoria aggiuntiva per la cache KV e le attivazioni.

PrecisioneSolo pesiEsempio di hardware
BF16 / FP16≈ 1002 GB8× GPU da 192 GB (circa 1.5 TB) oppure un cluster con più nodi
FP8≈ 501 GB8× GPU da 80 GB sono al limite; con 8× 141 GB o più si lavora comodamente
INT4 / 4-bit≈ 251 GBAlmeno 4× GPU da 80 GB, di più per contesti lunghi

Stime, non requisiti ufficiali. Li sostituiremo con i dati di Reflection quando sarà pubblicata la scheda del modello.