Zum Inhalt springen
reflectionbeam

Direktvergleich

Beam vs Inkling

13:2

Beam gewinnt 13 von 15 gemeinsamen Benchmarks

Fazit

Inkling von Thinking Machines Lab ist das andere große offene US-Modell mit offenen Gewichten aus dem Jahr 2026 und bereits unter Apache 2.0 verfügbar. Beam schlägt es bei 13 der 15 gemeinsamen Benchmarks, mit deutlichem Vorsprung bei SWE-Bench Pro, Terminal-Bench und CritPt. Inkling liegt bei IFBench und dem AA Omniscience-Index knapp vorne. Reflection merkt an, dass beim RL-Training von Inkling 30 Millionen Rollouts zum Einsatz kamen, gegenüber mehr als 100 Millionen bei Beam.

Benchmark für Benchmark

BenchmarkBeamInklingDifferenz
SWE-Bench Pro v2-Hard77,256,9+20,3
SWE-Bench Pro v165,554,3+11,2
Terminal-Bench v2.180,163,8+16,3
SWE-Bench Verified80,977,6+3,3
AIME 202697,897,1+0,7
Humanity's Last Exam (no tools)36,229,7+6,5
SciCode49,746,1+3,6
CritPt (AA)16,35,4+10,9
GPQA Diamond90,587,2+3,3
MCP Atlas78,776,0+2,7
τ³ banking38,025,0+13,0
BrowseComp (context mgmt)77,477,1+0,3
AA-LCR (long context)79,377,3+2,0
IFBench79,779,8-0,1
AA Omniscience index (public split)13,014,2-1,2

Alle Werte stammen aus der Ankündigung von Reflection (überarbeitete Fassung vom 8. Oktober 2026). Die Werte für Inkling sind die von Reflection zitierten Angaben von Artificial Analysis und DataCurve.

Die beiden Modelle

BeamInkling
EntwicklerReflection AIThinking Machines Lab
SitzVereinigte StaatenVereinigte Staaten
Parameter (gesamt / aktiv)501B / 23B975B / 41B
GewichteApache 2.0, für später im Oktober 2026 angekündigtApache 2.0
Veröffentlicht5. Oktober 202615. Juli 2026
ZugriffBeta-API mit Warteliste; Gewichte folgenHugging Face, Tinker API

Weitere Vergleiche