Перейти к содержимому
reflectionbeam

Внутри обучения Beam: 100 миллионов RL-траекторий на 10,500 GPU

Reflection сделала обучение с подкреплением одним из главных направлений масштабирования и заявляет, что улучшения пока не вышли на плато.

На этапе обучения Beam с подкреплением Reflection использовала 10,500 GPU NVIDIA GB300 в течение четырёх недель и сгенерировала более 100 миллионов траекторий с контекстом до 256K токенов. Для обучения и оценки использовали около 1.3 млрд песочниц почти в одном миллионе сред для программирования, работы ИИ-агентов и STEM-задач.

По словам компании, она разработала новые алгоритмы, которые обеспечивают стабильное полностью асинхронное обучение с подкреплением, даже если модель учится на данных, сгенерированных более чем за day до этого и примерно 107 версий весов назад относительно текущей политики.

Штраф за длину научил Beam не использовать лишние токены. Reflection также сообщает о переносе навыков: обучение задачам программирования и работы в терминале улучшило веб-поиск, а получив доступ к вебу, модель самостоятельно научилась обращаться к другим моделям и сервисам OCR.

Для сравнения: Reflection сообщает, что Inkling обучали на 30 миллионах роллаутов. Показатели продолжали расти, когда запуск завершился.

Главное

История эффективности Beam связана не только с размером модели, но и с масштабом RL.

Все новости