Pular para o conteúdo
reflectionbeam

Como usar

Como usar o Beam hoje

O Beam está em uma fase beta gradual. Veja todas as formas de acessá-lo agora, exemplos de código funcionais para a API compatível com OpenAI e o que muda quando os pesos abertos forem disponibilizados.

Suas opções agora

Do zero à primeira solicitação

  1. 01

    Entrar na lista de espera

    Crie uma conta em platform.reflection.ai. Novos cadastros precisam aguardar a liberação do acesso.

  2. 02

    Criar uma chave de API

    Na plataforma, abra API Keys e crie uma chave. Armazene-a na variável de ambiente REFLECTION_API_KEY.

  3. 03

    Direcione seu cliente para a Reflection

    Use a URL base https://api.reflection.ai/openai/v1 com qualquer SDK da OpenAI e o ID de modelo Beam-501B-A23B.

  4. 04

    Enviar uma conclusão de chat

    Chame Chat Completions como de costume. Opcionalmente, defina reasoning_effort para trocar velocidade por profundidade.

Exemplos de código

O endpoint segue o formato do OpenAI Chat Completions, então os SDKs oficiais da OpenAI funcionam após a alteração da URL base e da chave.

Primeira solicitação

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Streaming

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Variáveis de ambiente

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Nível de raciocínio

Beam sempre raciocina; não há como desativar isso. O parâmetro reasoning_effort controla a intensidade. O padrão é medium.

ValorComportamento
lowMenos raciocínio e menor latência. Para tarefas simples.
mediumEquilíbrio entre qualidade e latência. Usado quando você omite o parâmetro.
highMais raciocínio para problemas mais difíceis.
xhighMais raciocínio do que em high.
maxO máximo de raciocínio, para os problemas mais difíceis.

Os tokens de raciocínio contam para max_completion_tokens e para os limites de taxa. Se o limite for muito baixo, o modelo pode ficar sem tokens enquanto ainda raciocina e retornar uma resposta vazia com finish_reason "length". O texto do raciocínio é retornado separadamente em reasoning_content.

O que funciona e o que não funciona

Compatível

  • POST /chat/completions, GET /models, GET /models/{model}
  • Streaming, incluindo o uso no trecho final
  • Chamadas de ferramentas com tool_choice e parallel_tool_calls
  • Saídas estruturadas: json_object e json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Papéis system, developer, user, assistant e tool

Não compatível

  • APIs de Respostas, Incorporações, Imagens, Áudio, Arquivos, Lote e Assistants
  • Entradas de imagem, áudio ou arquivo: Beam aceita apenas texto
  • n diferente de 1, logprobs, logit_bias
  • Parâmetros como user, metadata, audio ou prediction (eles retornam um erro)
  • As sequências stop são aceitas, mas não têm efeito

Limites de taxa

Os limites se aplicam por organização, a solicitações e tokens por minuto e por dia UTC, além de um teto para solicitações simultâneas. Ultrapassar um deles retorna HTTP 429 com um cabeçalho Retry-After. Os limites diários são redefinidos às 00:00 UTC. Reflection ainda não publicou como solicitar limites mais altos, e não há uma tabela pública de preços para a versão beta.

Agentes de programação

Mirror CLI se conecta ao Beam usando apenas uma chave de API. Pi, OpenCode e Hermes funcionam pelas configurações de provedor compatível com OpenAI: URL base https://api.reflection.ai/openai/v1, modelo Beam-501B-A23B, chave obtida de REFLECTION_API_KEY. Mirror não oferece suporte nativo ao Windows.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Executar Beam por conta própria

Quando os pesos forem disponibilizados, será possível executar Beam com mecanismos de código aberto; a Reflection afirma que está trabalhando em integrações e parcerias para o lançamento. Planeje bastante memória: todos os 501 bilhões de parâmetros precisam ficar na memória da GPU, embora apenas 23 bilhões sejam ativados por token. Isso equivale a cerca de 1 TB em BF16, 500 GB em FP8 e 250 GB em 4 bits, sem contar o cache KV.