Перейти к содержимому
reflectionbeam

Лобовое сравнение

Beam vs DeepSeek V4.1 Flash

2:7

Beam лидирует в 2 из 9 общих бенчмарков

Итог

DeepSeek V4.1 Flash опережает Beam в 7 из 9 общих бенчмарков, значительно лидируя в DeepSWE и AutomationBench и на 10 баллов — в Terminal-Bench. Beam выигрывает в CritPt и показывает лучший индекс AA Omniscience, который учитывает уверенные, но неверные ответы. По эффективности Beam здесь тоже не впереди: DeepSeek V4.1 Flash активирует всего 16 миллиардов параметров на каждый сгенерированный токен — меньше, чем 23 миллиарда у Beam, — а веса этой модели уже опубликованы по лицензии MIT.

Сравнение по каждому бенчмарку

БенчмаркBeamDeepSeek V4.1 FlashРазница
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Все результаты взяты из анонса Reflection (редакция от 8 октября 2026 года). Результаты для DeepSeek V4.1 Flash приведены по данным Reflection, со ссылкой на Artificial Analysis и DataCurve.

Две модели

BeamDeepSeek V4.1 Flash
РазработчикReflection AIDeepSeek
Базируется вСШАКитай
Параметры (всего / активных)501B / 23B552B / 16B
ВесаApache 2.0, обещана на более поздний срок в октябре 2026 годаMIT
Дата выпуска5 октября 2026 г.10 сентября 2026 г.
Как получить доступБета-API с листом ожидания; веса появятся позжеHugging Face, DeepSeek API, OpenRouter

Другие сравнения