Vai al contenuto
reflectionbeam

Benchmark

Risultati di Beam nei benchmark

21 benchmark tra programmazione agentica, ragionamento, uso degli strumenti e competenze generali, esattamente come pubblicati da Reflection, a confronto con altri sette modelli open.

Sono dati comunicati dal fornitore nell'annuncio di Reflection (tabella aggiornata l'8 ottobre 2026). I punteggi degli altri modelli provengono da Artificial Analysis e DataCurve, come citato da Reflection. Le riproduzioni indipendenti arriveranno quando i pesi saranno pubblici.

BenchmarkBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144,4——44,061,068,051,074,2
SWE-Bench Pro v2-Hard77,256,9——84,388,2——
SWE-Bench Pro v165,554,346,462,1——67,7—
Terminal-Bench v2.180,163,856,481,088,288,386,690,6
SWE Atlas Codebase QnA34,6———61,068,0——
SWE-Bench Multilingual78,0—67,7—————
SWE-Bench Verified80,977,670,7—————
AIME 202697,897,1—99,2————
Humanity's Last Exam (no tools)36,229,726,740,542,346,943,639,1
SciCode49,746,144,6—59,058,752,152,0
CritPt (AA)16,35,43,120,919,123,420,014,3
GPQA Diamond90,587,287,091,291,793,592,690,9
AutomationBench (public)37,0——26,248,246,739,854,8
MCP Atlas78,776,063,177,884,282,384,5—
τ³ banking38,025,022,637,1—37,155,2—
BrowseComp (context mgmt)77,477,144,4——91,2——
DeepSearchQA (context mgmt)80,1————95,0——
AA-LCR (long context)79,377,379,378,379,788,780,384,0
LongBench v265,5—61,964,0——66,3—
IFBench79,779,881,773,3——82,8—
AA Omniscience index (public split)13,014,28,6—22,6——6,6

00.0 Miglior punteggio riportato nella riga— Non riportato

Cosa indicano i numeri

Beam dà il meglio nell'ingegneria del software. Ottiene 80.9 su SWE-Bench Verified (davanti a Inkling con 77.6) e 78.0 su SWE-Bench Multilingual (davanti a Nemotron 3 Ultra con 67.7), benchmark per i quali i modelli cinesi più grandi non hanno riportato risultati; inoltre supera di poco GLM 5.2 su SWE-Bench Pro v1 (65.5 contro 62.1) e MCP Atlas (78.7 contro 77.8).

Nel ragionamento puro si colloca poco dietro ai leader: 90.5 su GPQA Diamond contro 93.5 di Kimi K3 e 36.2 su Humanity's Last Exam senza strumenti contro 46.9.

La tesi di Reflection non è che Beam vinca in tutto, ma che si avvicini ai migliori consumando molta meno potenza di calcolo per risposta. Kimi K3, GLM 5.3 e Qwen 3.8 Max sono ancora in testa nella maggior parte delle categorie in cui hanno riportato risultati.

Cosa misura ciascun benchmark

Programmazione agentica e terminale

DeepSWE v1.1
Attività di ingegneria del software a lungo termine, completate dall'inizio alla fine da un agente.
SWE-Bench Pro v2-Hard
La parte più difficile di SWE-Bench Pro: problemi complessi di repository reali.
SWE-Bench Pro v1
Problemi reali di GitHub tratti da codebase professionali, più difficili e meno contaminati rispetto allo SWE-Bench classico.
Terminal-Bench v2.1
Completamento di attività in un vero terminale Linux: shell, strumenti, compilazioni e debug.
SWE Atlas Codebase QnA
Rispondere a domande su basi di codice ampie e poco familiari.
SWE-Bench Multilingual
Risoluzione di problemi in stile SWE-Bench in molti linguaggi di programmazione.
SWE-Bench Verified
Sottoinsieme di SWE-Bench verificato da persone: risolvere il problema in modo da superare i test nascosti.

Ragionamento

AIME 2026
Problemi dell’American Invitational Mathematics Examination 2026.
Humanity's Last Exam (no tools)
Humanity's Last Exam: domande di livello esperto in molti campi, a cui rispondere senza strumenti.
SciCode
Scrivere codice per risolvere problemi scientifici di livello di ricerca.
CritPt (AA)
Problemi di ragionamento in fisica di livello di ricerca, come eseguiti da Artificial Analysis.
GPQA Diamond
Domande di biologia, chimica e fisica di livello universitario avanzato, difficili da risolvere cercando informazioni.

Chiamata di strumenti e ricerca

AutomationBench (public)
Automatizzare flussi di lavoro aziendali articolati su più app.
MCP Atlas
Usare correttamente gli strumenti disponibili tramite il Model Context Protocol (MCP).
τ³ banking
Conversazioni di assistenza clienti in ambito bancario, con strumenti e policy.
BrowseComp (context mgmt)
Trovare informazioni difficili da reperire navigando sul web e gestendo il contesto.
DeepSearchQA (context mgmt)
Domande di ricerca articolate che richiedono di cercare e combinare più fonti.

Capacità generali

AA-LCR (long context)
Ragionamento su documenti molto lunghi (ragionamento su contesti estesi di Artificial Analysis).
LongBench v2
Comprendere e rispondere a domande su input lunghi.
IFBench
Seguire istruzioni precise e verificabili su formattazione e contenuti.
AA Omniscience index (public split)
Conoscenze fattuali con una penalità per le risposte errate date con sicurezza (allucinazioni).