Benchmark
Risultati di Beam nei benchmark
21 benchmark tra programmazione agentica, ragionamento, uso degli strumenti e competenze generali, esattamente come pubblicati da Reflection, a confronto con altri sette modelli open.
Sono dati comunicati dal fornitore nell'annuncio di Reflection (tabella aggiornata l'8 ottobre 2026). I punteggi degli altri modelli provengono da Artificial Analysis e DataCurve, come citato da Reflection. Le riproduzioni indipendenti arriveranno quando i pesi saranno pubblici.
| Benchmark | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | — | — | 44,0 | 61,0 | 68,0 | 51,0 | 74,2 |
| SWE-Bench Pro v2-Hard | 77,2 | 56,9 | — | — | 84,3 | 88,2 | — | — |
| SWE-Bench Pro v1 | 65,5 | 54,3 | 46,4 | 62,1 | — | — | 67,7 | — |
| Terminal-Bench v2.1 | 80,1 | 63,8 | 56,4 | 81,0 | 88,2 | 88,3 | 86,6 | 90,6 |
| SWE Atlas Codebase QnA | 34,6 | — | — | — | 61,0 | 68,0 | — | — |
| SWE-Bench Multilingual | 78,0 | — | 67,7 | — | — | — | — | — |
| SWE-Bench Verified | 80,9 | 77,6 | 70,7 | — | — | — | — | — |
| AIME 2026 | 97,8 | 97,1 | — | 99,2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36,2 | 29,7 | 26,7 | 40,5 | 42,3 | 46,9 | 43,6 | 39,1 |
| SciCode | 49,7 | 46,1 | 44,6 | — | 59,0 | 58,7 | 52,1 | 52,0 |
| CritPt (AA) | 16,3 | 5,4 | 3,1 | 20,9 | 19,1 | 23,4 | 20,0 | 14,3 |
| GPQA Diamond | 90,5 | 87,2 | 87,0 | 91,2 | 91,7 | 93,5 | 92,6 | 90,9 |
| AutomationBench (public) | 37,0 | — | — | 26,2 | 48,2 | 46,7 | 39,8 | 54,8 |
| MCP Atlas | 78,7 | 76,0 | 63,1 | 77,8 | 84,2 | 82,3 | 84,5 | — |
| τ³ banking | 38,0 | 25,0 | 22,6 | 37,1 | — | 37,1 | 55,2 | — |
| BrowseComp (context mgmt) | 77,4 | 77,1 | 44,4 | — | — | 91,2 | — | — |
| DeepSearchQA (context mgmt) | 80,1 | — | — | — | — | 95,0 | — | — |
| AA-LCR (long context) | 79,3 | 77,3 | 79,3 | 78,3 | 79,7 | 88,7 | 80,3 | 84,0 |
| LongBench v2 | 65,5 | — | 61,9 | 64,0 | — | — | 66,3 | — |
| IFBench | 79,7 | 79,8 | 81,7 | 73,3 | — | — | 82,8 | — |
| AA Omniscience index (public split) | 13,0 | 14,2 | 8,6 | — | 22,6 | — | — | 6,6 |
00.0 Miglior punteggio riportato nella riga— Non riportato
Cosa indicano i numeri
Beam dà il meglio nell'ingegneria del software. Ottiene 80.9 su SWE-Bench Verified (davanti a Inkling con 77.6) e 78.0 su SWE-Bench Multilingual (davanti a Nemotron 3 Ultra con 67.7), benchmark per i quali i modelli cinesi più grandi non hanno riportato risultati; inoltre supera di poco GLM 5.2 su SWE-Bench Pro v1 (65.5 contro 62.1) e MCP Atlas (78.7 contro 77.8).
Nel ragionamento puro si colloca poco dietro ai leader: 90.5 su GPQA Diamond contro 93.5 di Kimi K3 e 36.2 su Humanity's Last Exam senza strumenti contro 46.9.
La tesi di Reflection non è che Beam vinca in tutto, ma che si avvicini ai migliori consumando molta meno potenza di calcolo per risposta. Kimi K3, GLM 5.3 e Qwen 3.8 Max sono ancora in testa nella maggior parte delle categorie in cui hanno riportato risultati.
Cosa misura ciascun benchmark
Programmazione agentica e terminale
- DeepSWE v1.1
- Attività di ingegneria del software a lungo termine, completate dall'inizio alla fine da un agente.
- SWE-Bench Pro v2-Hard
- La parte più difficile di SWE-Bench Pro: problemi complessi di repository reali.
- SWE-Bench Pro v1
- Problemi reali di GitHub tratti da codebase professionali, più difficili e meno contaminati rispetto allo SWE-Bench classico.
- Terminal-Bench v2.1
- Completamento di attività in un vero terminale Linux: shell, strumenti, compilazioni e debug.
- SWE Atlas Codebase QnA
- Rispondere a domande su basi di codice ampie e poco familiari.
- SWE-Bench Multilingual
- Risoluzione di problemi in stile SWE-Bench in molti linguaggi di programmazione.
- SWE-Bench Verified
- Sottoinsieme di SWE-Bench verificato da persone: risolvere il problema in modo da superare i test nascosti.
Ragionamento
- AIME 2026
- Problemi dell’American Invitational Mathematics Examination 2026.
- Humanity's Last Exam (no tools)
- Humanity's Last Exam: domande di livello esperto in molti campi, a cui rispondere senza strumenti.
- SciCode
- Scrivere codice per risolvere problemi scientifici di livello di ricerca.
- CritPt (AA)
- Problemi di ragionamento in fisica di livello di ricerca, come eseguiti da Artificial Analysis.
- GPQA Diamond
- Domande di biologia, chimica e fisica di livello universitario avanzato, difficili da risolvere cercando informazioni.
Chiamata di strumenti e ricerca
- AutomationBench (public)
- Automatizzare flussi di lavoro aziendali articolati su più app.
- MCP Atlas
- Usare correttamente gli strumenti disponibili tramite il Model Context Protocol (MCP).
- τ³ banking
- Conversazioni di assistenza clienti in ambito bancario, con strumenti e policy.
- BrowseComp (context mgmt)
- Trovare informazioni difficili da reperire navigando sul web e gestendo il contesto.
- DeepSearchQA (context mgmt)
- Domande di ricerca articolate che richiedono di cercare e combinare più fonti.
Capacità generali
- AA-LCR (long context)
- Ragionamento su documenti molto lunghi (ragionamento su contesti estesi di Artificial Analysis).
- LongBench v2
- Comprendere e rispondere a domande su input lunghi.
- IFBench
- Seguire istruzioni precise e verificabili su formattazione e contenuti.
- AA Omniscience index (public split)
- Conoscenze fattuali con una penalità per le risposte errate date con sicurezza (allucinazioni).