Лобовое сравнение
Beam vs DeepSeek V4.1 Flash
Beam лидирует в 2 из 9 общих бенчмарков
Итог
DeepSeek V4.1 Flash опережает Beam в 7 из 9 общих бенчмарков, значительно лидируя в DeepSWE и AutomationBench и на 10 баллов — в Terminal-Bench. Beam выигрывает в CritPt и показывает лучший индекс AA Omniscience, который учитывает уверенные, но неверные ответы. По эффективности Beam здесь тоже не впереди: DeepSeek V4.1 Flash активирует всего 16 миллиардов параметров на каждый сгенерированный токен — меньше, чем 23 миллиарда у Beam, — а веса этой модели уже опубликованы по лицензии MIT.
Сравнение по каждому бенчмарку
| Бенчмарк | Beam | DeepSeek V4.1 Flash | Разница | |
|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 74,2 | -29,8 | |
| Terminal-Bench v2.1 | 80,1 | 90,6 | -10,5 | |
| Humanity's Last Exam (no tools) | 36,2 | 39,1 | -2,9 | |
| SciCode | 49,7 | 52,0 | -2,3 | |
| CritPt (AA) | 16,3 | 14,3 | +2,0 | |
| GPQA Diamond | 90,5 | 90,9 | -0,4 | |
| AutomationBench (public) | 37,0 | 54,8 | -17,8 | |
| AA-LCR (long context) | 79,3 | 84,0 | -4,7 | |
| AA Omniscience index (public split) | 13,0 | 6,6 | +6,4 |
Все результаты взяты из анонса Reflection (редакция от 8 октября 2026 года). Результаты для DeepSeek V4.1 Flash приведены по данным Reflection, со ссылкой на Artificial Analysis и DataCurve.
Две модели
| Beam | DeepSeek V4.1 Flash | |
|---|---|---|
| Разработчик | Reflection AI | DeepSeek |
| Базируется в | США | Китай |
| Параметры (всего / активных) | 501B / 23B | 552B / 16B |
| Веса | Apache 2.0, обещана на более поздний срок в октябре 2026 года | MIT |
| Дата выпуска | 5 октября 2026 г. | 10 сентября 2026 г. |
| Как получить доступ | Бета-API с листом ожидания; веса появятся позже | Hugging Face, DeepSeek API, OpenRouter |
Другие сравнения
Z.ai (Zhipu AI)
Beam vs GLM 5.2
Moonshot AI
Beam vs Kimi K3
Alibaba (Qwen)
Beam vs Qwen 3.8 Max
Z.ai (Zhipu AI)
Beam vs GLM 5.3
NVIDIA
Beam vs Nemotron 3 Ultra
Thinking Machines Lab