Перейти к содержимому
reflectionbeam

Как пользоваться

Как пользоваться Beam сегодня

Beam проходит поэтапное бета-тестирование. Здесь собраны все доступные сейчас способы получить к нему доступ, рабочий код для совместимого с OpenAI API и объяснение, что изменится после выхода открытых весов.

Доступные сейчас варианты

От нуля до первого запроса

  1. 01

    Встать в лист ожидания

    Создайте аккаунт на platform.reflection.ai. Новые пользователи остаются в листе ожидания, пока им не предоставят доступ.

  2. 02

    Создать API-ключ

    На платформе откройте раздел API Keys и создайте ключ. Сохраните его в переменной окружения REFLECTION_API_KEY.

  3. 03

    Настройте клиент для работы с Reflection

    Используйте базовый URL https://api.reflection.ai/openai/v1 с любым SDK OpenAI и идентификатор модели Beam-501B-A23B.

  4. 04

    Отправить запрос Chat Completions

    Вызывайте Chat Completions как обычно. При желании задайте reasoning_effort, чтобы выбрать баланс между скоростью и глубиной.

Примеры кода

Эндпоинт использует формат OpenAI Chat Completions, поэтому официальные SDK OpenAI будут работать после замены базового URL и ключа.

Первый запрос

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Потоковая передача

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Переменные окружения

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Уровень рассуждений

Beam всегда рассуждает — отключить это нельзя. Параметр reasoning_effort задаёт глубину рассуждений. По умолчанию используется medium.

ЗначениеПоведение
lowМинимум рассуждений и наименьшая задержка. Для простых задач.
mediumБаланс качества и задержки. Используется, если параметр не задан.
highБольше рассуждений для более сложных задач.
xhighБольше рассуждений, чем при high.
maxМаксимум рассуждений для самых сложных задач.

Токены рассуждений учитываются в max_completion_tokens и лимитах запросов. Если лимит слишком низкий, модель может исчерпать его в процессе рассуждений и вернуть пустой ответ с finish_reason "length". Текст рассуждений передаётся отдельно в reasoning_content.

Что поддерживается, а что нет

Поддерживается

  • POST /chat/completions, GET /models, GET /models/{model}
  • Потоковая передача, включая данные об использовании токенов в последнем фрагменте
  • Вызов инструментов с tool_choice и parallel_tool_calls
  • Структурированный вывод: json_object и json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Роли system, developer, user, assistant и tool

Не поддерживается

  • API Responses, Embeddings, Images, Audio, Files, Batch и Assistants
  • Ввод изображений, аудио и файлов: Beam работает только с текстом
  • n, отличное от 1, logprobs, logit_bias
  • Такие параметры, как user, metadata, audio и prediction (они приводят к ошибке)
  • Последовательности stop принимаются, но не влияют на результат

Лимиты запросов

Лимиты для каждой организации: по количеству запросов и токенов в минуту и за сутки по UTC, а также по числу одновременных запросов. При превышении любого лимита возвращается HTTP 429 с заголовком Retry-After. Суточные лимиты сбрасываются в 00:00 UTC. Reflection пока не опубликовала инструкции по запросу повышенных лимитов, а открытого прайс-листа для бета-версии нет.

Агенты для программирования

Mirror CLI подключается к Beam только с помощью API-ключа. Pi, OpenCode и Hermes работают через настройки совместимого с OpenAI провайдера: базовый URL https://api.reflection.ai/openai/v1, модель Beam-501B-A23B, ключ из REFLECTION_API_KEY. Mirror не поддерживает Windows.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Запуск Beam на собственном оборудовании

Когда веса станут доступны, Beam можно будет запускать с помощью движков с открытым исходным кодом; Reflection сообщает, что работает над интеграциями и партнёрствами для запуска. Потребуется много памяти: все 501 миллиард параметров должны помещаться в память GPU, хотя на каждый токен активны только 23 миллиарда. Это примерно 1 TB в BF16, 500 GB в FP8 и 250 GB в 4-bit, без учёта KV-кэша.