Cách sử dụng
Cách sử dụng Beam ngay hôm nay
Beam đang trong giai đoạn beta với quyền truy cập được cấp dần. Dưới đây là mọi cách để truy cập Beam ngay lúc này, mã hoạt động với API tương thích với OpenAI và những thay đổi khi bộ trọng số mở được phát hành.
Các lựa chọn hiện có
API beta của Reflection
Đăng ký trên nền tảng Reflection và tham gia danh sách chờ. Khi được cấp quyền truy cập, bạn có thể tạo khóa API và gọi Beam qua một endpoint tương thích với OpenAI.
Tham gia danh sách chờMirror CLI
Tác nhân lập trình cho terminal do Reflection phát triển, hỗ trợ macOS (Apple Silicon) và Linux. Công cụ này mặc định sử dụng Beam và cần cùng khóa API.
Bắt đầu nhanh với MirrorTrò chuyện trên trình duyệt
BeamAI.chat là một trang trò chuyện độc lập, sẽ chuyển sang Beam ngay khi Beam được phát hành công khai. Cho đến lúc đó, trang này sử dụng một mô hình mở tương đương và nói rõ điều đó.
Mở BeamAI.chatTải bộ trọng số
Hiện chưa thể tải. Reflection đã hứa phát hành bộ trọng số theo giấy phép Apache 2.0 vào cuối tháng 10 năm 2026. Chúng tôi theo dõi việc phát hành hằng ngày.
Theo dõi tiến độ phát hànhTừ con số không đến yêu cầu đầu tiên
- 01
Tham gia danh sách chờ
Tạo tài khoản tại platform.reflection.ai. Người đăng ký mới sẽ phải chờ đến khi được cấp quyền truy cập.
- 02
Tạo khóa API
Trong nền tảng, mở mục API Keys và tạo khóa. Lưu khóa này vào biến môi trường REFLECTION_API_KEY.
- 03
Trỏ ứng dụng khách đến Reflection
Dùng URL cơ sở https://api.reflection.ai/openai/v1 với bất kỳ SDK OpenAI nào và ID mô hình Beam-501B-A23B.
- 04
Gửi yêu cầu hoàn tất cuộc trò chuyện
Gọi Chat Completions như thường lệ. Bạn có thể đặt reasoning_effort để cân bằng giữa tốc độ và độ sâu.
Ví dụ mã
Endpoint tuân theo định dạng OpenAI Chat Completions, vì vậy các SDK chính thức của OpenAI sẽ hoạt động sau khi bạn đổi URL cơ sở và khóa API.
Yêu cầu đầu tiên
curl https://api.reflection.ai/openai/v1/chat/completions \
-H "Authorization: Bearer $REFLECTION_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "Beam-501B-A23B",
"messages": [{"role": "user", "content": "Explain Mixture-of-Experts in two sentences."}],
"reasoning_effort": "medium"
}'Truyền phát
stream = client.chat.completions.create(
model="Beam-501B-A23B",
messages=[{"role": "user", "content": "Write a haiku about sparse experts."}],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta
# reasoning arrives first in delta.reasoning_content, then the answer in delta.content
if delta.content:
print(delta.content, end="", flush=True)Biến môi trường
export REFLECTION_API_KEY="<your API key>"
# Tools that read the standard OpenAI variables and use Chat Completions
export OPENAI_BASE_URL="https://api.reflection.ai/openai/v1"
export OPENAI_API_KEY="$REFLECTION_API_KEY"
# Check which models your key can use
curl https://api.reflection.ai/openai/v1/models -H "Authorization: Bearer $REFLECTION_API_KEY"Mức độ suy luận
Beam luôn suy luận; không có cách nào tắt tính năng này. Tham số reasoning_effort kiểm soát mức độ suy luận. Giá trị mặc định là medium.
| Giá trị | Cách hoạt động |
|---|---|
| low | Mức suy luận thấp nhất, độ trễ thấp nhất. Dành cho các tác vụ đơn giản. |
| medium | Cân bằng giữa chất lượng và độ trễ. Được dùng khi bạn không chỉ định tham số này. |
| high | Suy luận nhiều hơn cho các vấn đề khó hơn. |
| xhigh | Suy luận nhiều hơn mức high. |
| max | Mức suy luận cao nhất, dành cho những vấn đề khó nhất. |
Token suy luận được tính vào max_completion_tokens và giới hạn tốc độ. Nếu giới hạn quá thấp, mô hình có thể hết token khi vẫn đang suy luận và trả về câu trả lời trống với finish_reason "length". Văn bản suy luận được trả về riêng trong reasoning_content.
Những gì hoạt động và không hoạt động
Được hỗ trợ
- POST /chat/completions, GET /models, GET /models/{model}
- Truyền phát, bao gồm thông tin sử dụng trong phần dữ liệu cuối cùng
- Gọi công cụ với tool_choice và parallel_tool_calls
- Đầu ra có cấu trúc: json_object và json_schema
- temperature, top_p, frequency_penalty, presence_penalty, max_completion_tokens, seed
- Các vai trò system, developer, user, assistant và tool
Không được hỗ trợ
- API Responses, Embeddings, Images, Audio, Files, Batch và Assistants
- Đầu vào hình ảnh, âm thanh hoặc tệp: Beam chỉ xử lý văn bản
- n khác 1, logprobs, logit_bias
- Các tham số như user, metadata, audio hoặc prediction (chúng sẽ trả về lỗi)
- Các chuỗi stop được chấp nhận nhưng không có tác dụng
Giới hạn tốc độ
Giới hạn áp dụng cho từng tổ chức, theo số yêu cầu và token mỗi phút và mỗi ngày UTC, đồng thời có giới hạn số yêu cầu đồng thời. Vượt quá bất kỳ giới hạn nào sẽ trả về HTTP 429 kèm tiêu đề Retry-After. Giới hạn hằng ngày được đặt lại lúc 00:00 UTC. Reflection chưa công bố cách yêu cầu tăng giới hạn và cũng chưa có bảng giá công khai cho bản beta.
Tác nhân lập trình
Mirror CLI kết nối với Beam chỉ bằng một khóa API. Pi, OpenCode và Hermes hoạt động thông qua cài đặt nhà cung cấp tương thích với OpenAI: URL cơ sở https://api.reflection.ai/openai/v1, mô hình Beam-501B-A23B, khóa lấy từ REFLECTION_API_KEY. Mirror không hỗ trợ Windows gốc.
curl -fsSL https://raw.githubusercontent.com/reflection-oss/mirror-beta/main/install.sh | bash
cd your-project
mirror # uses Reflection and Beam-501B-A23B by defaultTự chạy Beam
Khi các trọng số được phát hành, có thể chạy Beam bằng các engine mã nguồn mở; Reflection cho biết đang phát triển các tích hợp và tìm kiếm đối tác ra mắt. Hãy chuẩn bị nhiều bộ nhớ: cả 501 tỷ tham số phải nằm trong bộ nhớ GPU, dù mỗi token chỉ kích hoạt 23 tỷ tham số. Con số này tương đương khoảng 1 TB ở BF16, 500 GB ở FP8 và 250 GB ở 4-bit, chưa tính bộ nhớ đệm KV.