Lewati ke konten
reflectionbeam

Adu langsung

Beam vs DeepSeek V4.1 Flash

2:7

Beam unggul pada 2 dari 9 benchmark yang sama

Kesimpulan

DeepSeek V4.1 Flash unggul pada 7 dari 9 benchmark yang sama, dengan keunggulan besar pada DeepSWE dan AutomationBench serta keunggulan 10 poin pada Terminal-Bench. Beam menang pada CritPt dan memiliki indeks AA Omniscience yang lebih baik, yang memberi penalti pada jawaban salah yang disampaikan dengan yakin. Dalam hal efisiensi, Beam tidak unggul di sini: DeepSeek V4.1 Flash hanya mengaktifkan 16 miliar parameter per token yang dihasilkan, lebih sedikit daripada 23 miliar milik Beam, dan bobotnya sudah tersedia untuk publik dengan lisensi MIT.

Perbandingan per benchmark

BenchmarkBeamDeepSeek V4.1 FlashSelisih
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Semua skor berasal dari pengumuman Reflection (revisi 8 Oktober 2026). Skor untuk DeepSeek V4.1 Flash adalah sebagaimana dikutip Reflection dari Artificial Analysis dan DataCurve.

Kedua model

BeamDeepSeek V4.1 Flash
DeveloperReflection AIDeepSeek
Berbasis diAmerika SerikatChina
Parameter (total / aktif)501B / 23B552B / 16B
BobotApache 2.0, dijanjikan hadir nanti pada Oktober 2026MIT
Dirilis5 Oktober 202610 September 2026
Cara mengaksesAPI beta masuk daftar tunggu; bobot segera hadirHugging Face, DeepSeek API, OpenRouter

Perbandingan lainnya