Chuyển đến nội dung
reflectionbeam

Cách sử dụng

Cách sử dụng Beam ngay hôm nay

Beam đang trong giai đoạn beta với quyền truy cập được cấp dần. Dưới đây là mọi cách để truy cập Beam ngay lúc này, mã hoạt động với API tương thích với OpenAI và những thay đổi khi bộ trọng số mở được phát hành.

Các lựa chọn hiện có

Từ con số không đến yêu cầu đầu tiên

  1. 01

    Tham gia danh sách chờ

    Tạo tài khoản tại platform.reflection.ai. Người đăng ký mới sẽ phải chờ đến khi được cấp quyền truy cập.

  2. 02

    Tạo khóa API

    Trong nền tảng, mở mục API Keys và tạo khóa. Lưu khóa này vào biến môi trường REFLECTION_API_KEY.

  3. 03

    Trỏ ứng dụng khách đến Reflection

    Dùng URL cơ sở https://api.reflection.ai/openai/v1 với bất kỳ SDK OpenAI nào và ID mô hình Beam-501B-A23B.

  4. 04

    Gửi yêu cầu hoàn tất cuộc trò chuyện

    Gọi Chat Completions như thường lệ. Bạn có thể đặt reasoning_effort để cân bằng giữa tốc độ và độ sâu.

Ví dụ mã

Endpoint tuân theo định dạng OpenAI Chat Completions, vì vậy các SDK chính thức của OpenAI sẽ hoạt động sau khi bạn đổi URL cơ sở và khóa API.

Yêu cầu đầu tiên

curl https://api.reflection.ai/openai/v1/chat/completions \
  -H "Authorization: Bearer $REFLECTION_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Beam-501B-A23B",
    "messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
    "reasoning_effort": "medium"
  }'

Truyền phát

stream = client.chat.completions.create(
    model="Beam-501B-A23B",
    messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta
    # reasoning arrives first in delta.reasoning_content, then the answer in delta.content
    if delta.content:
        print(delta.content, end="", flush=True)

Biến môi trường

export REFLECTION_API_KEY="<your API key>"

# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"

# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"

Mức độ suy luận

Beam luôn suy luận; không có cách nào tắt tính năng này. Tham số reasoning_effort kiểm soát mức độ suy luận. Giá trị mặc định là medium.

Giá trịCách hoạt động
lowMức suy luận thấp nhất, độ trễ thấp nhất. Dành cho các tác vụ đơn giản.
mediumCân bằng giữa chất lượng và độ trễ. Được dùng khi bạn không chỉ định tham số này.
highSuy luận nhiều hơn cho các vấn đề khó hơn.
xhighSuy luận nhiều hơn mức high.
maxMức suy luận cao nhất, dành cho những vấn đề khó nhất.

Token suy luận được tính vào max_completion_tokens và giới hạn tốc độ. Nếu giới hạn quá thấp, mô hình có thể hết token khi vẫn đang suy luận và trả về câu trả lời trống với finish_reason "length". Văn bản suy luận được trả về riêng trong reasoning_content.

Những gì hoạt động và không hoạt động

Được hỗ trợ

  • POST /chat/completions, GET /models, GET /models/{model}
  • Truyền phát, bao gồm thông tin sử dụng trong phần dữ liệu cuối cùng
  • Gọi công cụ với tool_choice và parallel_tool_calls
  • Đầu ra có cấu trúc: json_object và json_schema
  • temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
  • Các vai trò system, developer, user, assistant và tool

Không được hỗ trợ

  • API Responses, Embeddings, Images, Audio, Files, Batch và Assistants
  • Đầu vào hình ảnh, âm thanh hoặc tệp: Beam chỉ xử lý văn bản
  • n khác 1, logprobs, logit_bias
  • Các tham số như user, metadata, audio hoặc prediction (chúng sẽ trả về lỗi)
  • Các chuỗi stop được chấp nhận nhưng không có tác dụng

Giới hạn tốc độ

Giới hạn áp dụng cho từng tổ chức, theo số yêu cầu và token mỗi phút và mỗi ngày UTC, đồng thời có giới hạn số yêu cầu đồng thời. Vượt quá bất kỳ giới hạn nào sẽ trả về HTTP 429 kèm tiêu đề Retry-After. Giới hạn hằng ngày được đặt lại lúc 00:00 UTC. Reflection chưa công bố cách yêu cầu tăng giới hạn và cũng chưa có bảng giá công khai cho bản beta.

Tác nhân lập trình

Mirror CLI kết nối với Beam chỉ bằng một khóa API. Pi, OpenCode và Hermes hoạt động thông qua cài đặt nhà cung cấp tương thích với OpenAI: URL cơ sở https://api.reflection.ai/openai/v1, mô hình Beam-501B-A23B, khóa lấy từ REFLECTION_API_KEY. Mirror không hỗ trợ Windows gốc.

curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash

cd your-project
mirror        # uses Reflection and Beam-501B-A23B by default

Tự chạy Beam

Khi các trọng số được phát hành, có thể chạy Beam bằng các engine mã nguồn mở; Reflection cho biết đang phát triển các tích hợp và tìm kiếm đối tác ra mắt. Hãy chuẩn bị nhiều bộ nhớ: cả 501 tỷ tham số phải nằm trong bộ nhớ GPU, dù mỗi token chỉ kích hoạt 23 tỷ tham số. Con số này tương đương khoảng 1 TB ở BF16, 500 GB ở FP8 và 250 GB ở 4-bit, chưa tính bộ nhớ đệm KV.