Перейти к содержимому
reflectionbeam

Карточка модели

Характеристики Beam

Всё, что Reflection AI опубликовала о том, как устроена и обучалась Beam. Данные взяты из официального анонса и документации для разработчиков; оценки помечены.

Краткий обзор

РазработчикReflection AI (New York)
Анонсирована2026-10-05
Тип моделиЯзыковая модель со смесью экспертов и разреженной активацией
Всего параметров501B
Активных параметров на токен23B
Слои52
ВниманиеЧередование локального и глобального внимания
Контекстное окно (бета-версия API)256K tokens
Длина контекста, достигнутая на промежуточном этапе обучения1M tokens
Максимальный объём вывода (API)128K tokens
Дата отсечения знаний2026-06-30
МодальностиТекст на входе, текст на выходе
РассуждениеВсегда включён, с настройкой интенсивности рассуждений
Возможности APIВызов инструментов, структурированный вывод, потоковая передача
Лицензия на весаApache 2.0 (веса обещают выпустить позже, в октябре 2026 года)
Идентификатор модели APIBeam-501B-A23B

Почему всего 501B параметров, а активны только 23B?

В модели со смесью экспертов каждый слой содержит множество небольших сетей-«экспертов», а маршрутизатор выбирает несколько из них для обработки каждого токена. В Beam 501 миллиард параметров, но каждый токен проходит только примерно через 23 миллиарда из них.

В результате вычислительная нагрузка на токен близка к нагрузке плотной модели с 23B параметров, поэтому Beam дешевле обслуживать, а общая ёмкость модели остаётся большой. Но есть нюанс: память. Для работы модели все 501B параметров должны находиться в памяти GPU.

По словам Reflection, маршрутизация у модели необычно сбалансирована: к концу предобучения на самого загруженного эксперта приходилось лишь 1.04× средней нагрузки, так что используются все эксперты.

501B100%
23B4.6%

Как обучали Beam

Предобучение

23,8 триллиона токенов из интернета, общедоступных источников и лицензированных наборов данных, с особым упором на код, технические тексты и STEM. Отсеяли около 95% исходных веб-токенов. Обучение провели менее чем за четыре недели на 6,144 NVIDIA GB300 NVL72 GPU; ближе к концу показатель полезной производительности достиг 92.3%.

Промежуточное обучение

Этап, призванный подготовить модель к обучению с подкреплением: длинные документы с насыщенными рассуждениями, репозитории кода и задачи с длинным горизонтом планирования. На этом этапе эффективный контекст Beam расширили до 1 миллиона токенов.

Обучение с подкреплением

Более 100 миллионов прогонов на 10,500 GB300 GPU за четыре недели: почти в миллионе сред для задач программирования, работы агентов и STEM и примерно 1.3 миллиарда изолированных сред. Reflection называет этот запуск RL одним из крупнейших среди открытых лабораторий и сообщает, что результаты продолжали улучшаться к моменту его завершения.

Безопасность и выравнивание

Отдельную модель безопасности и выравнивания обучили на той же базовой модели, а затем объединили с моделью RL с помощью дистилляции по политике с несколькими учителями. Reflection сообщает, что опубликует оценки безопасности в техническом отчёте и откроет исходный код внутренних оценок безопасности.

Интенсивность рассуждений и эффективность использования токенов

Beam обучали с помощью штрафа за длину ответа: он поощряет правильные ответы и препятствует использованию лишних токенов. В API можно выбрать интенсивность рассуждений: при низких значениях модель отвечает быстрее и использует меньше токенов, а при высоких дольше обдумывает сложные задачи.

Сколько памяти нужно Beam?

Reflection пока не публиковала требования к оборудованию. Ниже приведены наши примерные оценки только для весов (число параметров × байт на параметр). Для реального развёртывания потребуется дополнительная память для KV-кэша и активаций.

ТочностьТолько весаПример конфигурации оборудования
BF16 / FP16≈ 1 002 GB8× GPU по 192 GB (около 1.5 TB) или кластер из нескольких узлов
FP8≈ 501 GB8× GPU по 80 GB — впритык; с 8× по 141 GB или больше будет достаточно
INT4 / 4-bit≈ 251 GBМинимум 4 GPU по 80 GB; для длинного контекста потребуется больше

Это оценки, а не официальные требования. Заменим их данными Reflection, когда выйдет карточка модели.