본문으로 건너뛰기
reflectionbeam

사용 방법

오늘 Beam 사용하기

Beam은 단계적으로 베타 공개 중입니다. 지금 이용할 수 있는 모든 방법, OpenAI 호환 API를 위한 작동하는 코드, 오픈 웨이트가 공개된 후 달라지는 점을 안내합니다.

지금 이용할 수 있는 옵션

첫 요청까지, 처음부터

  1. 01

    대기자 명단에 등록

    platform.reflection.ai에서 계정을 만드세요. 새로 가입한 사용자는 액세스가 활성화될 때까지 기다려야 합니다.

  2. 02

    API 키 만들기

    플랫폼에서 API Keys를 열고 키를 만드세요. 키는 REFLECTION_API_KEY 환경 변수에 저장하세요.

  3. 03

    클라이언트가 Reflection을 사용하도록 설정

    OpenAI SDK를 사용해도 됩니다. 기본 URL은 https://api.reflection.ai/openai/v1이고 모델 ID는 Beam-501B-A23B입니다.

  4. 04

    채팅 완성 요청 보내기

    평소처럼 Chat Completions를 호출하세요. 선택적으로 reasoning_effort를 설정해 속도와 깊이의 균형을 조절할 수 있습니다.

코드 예제

엔드포인트는 OpenAI Chat Completions 형식을 따르므로, 기본 URL과 키를 변경하면 공식 OpenAI SDK를 사용할 수 있습니다.

첫 요청

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

스트리밍

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

환경 변수

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

추론 수준

Beam은 항상 추론하며, 추론을 끄는 방법은 없습니다. reasoning_effort 매개변수로 추론의 깊이를 조절할 수 있습니다. 기본값은 medium입니다.

값동작
low추론 수준이 가장 낮고 지연 시간이 가장 짧습니다. 간단한 작업에 적합합니다.
medium품질과 지연 시간의 균형을 맞춥니다. 매개변수를 생략하면 이 값이 사용됩니다.
high더 어려운 문제를 위해 추론을 강화합니다.
xhighhigh보다 더 많이 추론합니다.
max가장 어려운 문제를 위해 추론을 최대한 강화합니다.

추론 토큰은 max_completion_tokens와 요청 한도에 포함됩니다. 한도가 너무 낮으면 모델이 추론 도중 토큰을 모두 사용해, finish_reason이 "length"인 빈 응답을 반환할 수 있습니다. 추론 텍스트는 reasoning_content에 별도로 반환됩니다.

지원되는 기능과 지원되지 않는 기능

지원됨

  • POST /chat/completions, GET /models, GET /models/{model}
  • 마지막 청크의 사용량 정보를 포함한 스트리밍
  • tool_choice 및 parallel_tool_calls를 사용한 도구 호출
  • 구조화된 출력: json_object 및 json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • system, developer, user, assistant 및 tool 역할

지원되지 않음

  • Responses, Embeddings, Images, Audio, Files, Batch 및 Assistants API
  • 이미지, 오디오 또는 파일 입력: Beam은 텍스트 전용입니다
  • 1이 아닌 n, logprobs, logit_bias
  • user, metadata, audio 또는 prediction과 같은 매개변수(오류가 반환됨)
  • stop 시퀀스는 허용되지만 효과가 없습니다

요청 한도

한도는 조직별로 적용되며, 분당 요청 수와 토큰 수, UTC 기준 일일 한도, 동시 요청 수 상한이 포함됩니다. 한도를 초과하면 Retry-After 헤더와 함께 HTTP 429가 반환됩니다. 일일 한도는 UTC 00:00에 초기화됩니다. Reflection은 아직 한도를 높이는 방법을 공개하지 않았으며, 베타 공개 가격표도 없습니다.

코딩 에이전트

Mirror CLI는 API 키만으로 Beam에 연결됩니다. Pi, OpenCode, Hermes는 OpenAI 호환 공급자 설정을 통해 작동합니다. 기본 URL은 https://api.reflection.ai/openai/v1, 모델은 Beam-501B-A23B, 키는 REFLECTION_API_KEY에서 가져옵니다. Mirror는 기본 Windows를 지원하지 않습니다.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

직접 Beam 실행하기

가중치가 공개되면 오픈소스 엔진으로 Beam을 구동할 수 있습니다. Reflection은 통합 작업과 출시 파트너 확보를 진행 중이라고 밝혔습니다. 메모리가 많이 필요하다는 점에 유의하세요. 토큰마다 230억 개만 활성화되더라도 5010억 개의 모든 파라미터를 GPU 메모리에 올려야 합니다. KV 캐시를 제외하면 BF16 기준 약 1 TB, FP8 기준 500 GB, 4비트 기준 250 GB가 필요합니다.