Como usar
Como usar o Beam hoje
O Beam está em uma fase beta gradual. Veja todas as formas de acessá-lo agora, exemplos de código funcionais para a API compatível com OpenAI e o que muda quando os pesos abertos forem disponibilizados.
Suas opções agora
API beta da Reflection
Cadastre-se na plataforma Reflection e entre na lista de espera. Depois que o acesso for liberado, você poderá criar chaves de API e chamar o Beam por um endpoint compatível com OpenAI.
Entrar na lista de esperaMirror CLI
Agente de programação da própria Reflection para o terminal, disponível no macOS (Apple Silicon) e no Linux. Ele usa o Beam por padrão e precisa da mesma chave de API.
Guia de início rápido do MirrorConverse no navegador
BeamAI.chat é um site de chat independente que passará a usar o Beam assim que ele estiver disponível publicamente. Até lá, ele usa um modelo aberto comparável e informa isso claramente.
Abrir o BeamAI.chatBaixar os pesos
Ainda não é possível. A Reflection prometeu disponibilizar os pesos sob a licença Apache 2.0 no final de outubro de 2026. Acompanhamos o lançamento diariamente.
Acompanhamento do lançamentoDo zero à primeira solicitação
- 01
Entrar na lista de espera
Crie uma conta em platform.reflection.ai. Novos cadastros precisam aguardar a liberação do acesso.
- 02
Criar uma chave de API
Na plataforma, abra API Keys e crie uma chave. Armazene-a na variável de ambiente REFLECTION_API_KEY.
- 03
Direcione seu cliente para a Reflection
Use a URL base https://api.reflection.ai/openai/v1 com qualquer SDK da OpenAI e o ID de modelo Beam-501B-A23B.
- 04
Enviar uma conclusão de chat
Chame Chat Completions como de costume. Opcionalmente, defina reasoning_effort para trocar velocidade por profundidade.
Exemplos de código
O endpoint segue o formato do OpenAI Chat Completions, então os SDKs oficiais da OpenAI funcionam após a alteração da URL base e da chave.
Primeira solicitação
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Streaming
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Variáveis de ambiente
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Nível de raciocínio
Beam sempre raciocina; não há como desativar isso. O parâmetro reasoning_effort controla a intensidade. O padrão é medium.
| Valor | Comportamento |
|---|---|
| low | Menos raciocínio e menor latência. Para tarefas simples. |
| medium | Equilíbrio entre qualidade e latência. Usado quando você omite o parâmetro. |
| high | Mais raciocínio para problemas mais difíceis. |
| xhigh | Mais raciocínio do que em high. |
| max | O máximo de raciocínio, para os problemas mais difíceis. |
Os tokens de raciocínio contam para max_completion_tokens e para os limites de taxa. Se o limite for muito baixo, o modelo pode ficar sem tokens enquanto ainda raciocina e retornar uma resposta vazia com finish_reason "length". O texto do raciocínio é retornado separadamente em reasoning_content.
O que funciona e o que não funciona
Compatível
- POST /chat/completions, GET /models, GET /models/{model}
- Streaming, incluindo o uso no trecho final
- Chamadas de ferramentas com tool_choice e parallel_tool_calls
- Saídas estruturadas: json_object e json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Papéis system, developer, user, assistant e tool
Não compatível
- APIs de Respostas, Incorporações, Imagens, Áudio, Arquivos, Lote e Assistants
- Entradas de imagem, áudio ou arquivo: Beam aceita apenas texto
- n diferente de 1, logprobs, logit_bias
- Parâmetros como user, metadata, audio ou prediction (eles retornam um erro)
- As sequências stop são aceitas, mas não têm efeito
Limites de taxa
Os limites se aplicam por organização, a solicitações e tokens por minuto e por dia UTC, além de um teto para solicitações simultâneas. Ultrapassar um deles retorna HTTP 429 com um cabeçalho Retry-After. Os limites diários são redefinidos às 00:00 UTC. Reflection ainda não publicou como solicitar limites mais altos, e não há uma tabela pública de preços para a versão beta.
Agentes de programação
Mirror CLI se conecta ao Beam usando apenas uma chave de API. Pi, OpenCode e Hermes funcionam pelas configurações de provedor compatível com OpenAI: URL base https://api.reflection.ai/openai/v1, modelo Beam-501B-A23B, chave obtida de REFLECTION_API_KEY. Mirror não oferece suporte nativo ao Windows.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultExecutar Beam por conta própria
Quando os pesos forem disponibilizados, será possível executar Beam com mecanismos de código aberto; a Reflection afirma que está trabalhando em integrações e parcerias para o lançamento. Planeje bastante memória: todos os 501 bilhões de parâmetros precisam ficar na memória da GPU, embora apenas 23 bilhões sejam ativados por token. Isso equivale a cerca de 1 TB em BF16, 500 GB em FP8 e 250 GB em 4 bits, sem contar o cache KV.