Chuyển đến nội dung
reflectionbeam

Thẻ mô hình

Thông số Beam

Tất cả thông tin Reflection AI đã công bố về cách Beam được xây dựng và huấn luyện. Số liệu lấy từ thông báo chính thức và tài liệu dành cho nhà phát triển; các ước tính được ghi chú rõ.

Tổng quan

Nhà phát triểnReflection AI (New York)
Ngày công bố2026-10-05
Loại mô hìnhMô hình ngôn ngữ Mixture-of-Experts thưa
Tổng số tham số501B
Tham số hoạt động trên mỗi token23B
Số lớp52
Cơ chế chú ýCơ chế chú ý cục bộ và toàn cục xen kẽ
Cửa sổ ngữ cảnh (API beta)256K tokens
Độ dài ngữ cảnh đạt được trong giai đoạn huấn luyện giữa kỳ1M tokens
Độ dài đầu ra tối đa (API)128K tokens
Mốc kiến thức2026-06-30
Phương thức đầu vào/đầu raVăn bản đầu vào, văn bản đầu ra
Suy luậnLuôn bật, có tùy chọn mức độ suy luận
Tính năng APIGọi công cụ, đầu ra có cấu trúc, truyền phát
Giấy phép trọng sốApache 2.0 (dự kiến công bố trọng số vào cuối tháng 10 năm 2026)
ID mô hình APIBeam-501B-A23B

Vì sao tổng cộng 501B nhưng chỉ kích hoạt 23B?

Trong mô hình Mixture-of-Experts, mỗi lớp chứa nhiều mạng “chuyên gia” nhỏ và một bộ định tuyến chọn một vài mạng cho mỗi token. Beam có 501 tỷ tham số, nhưng mỗi token chỉ đi qua khoảng 23 tỷ tham số trong số đó.

Kết quả là lượng tính toán cho mỗi token gần bằng mô hình dày đặc 23B, giúp triển khai Beam với chi phí thấp hơn, trong khi tổng dung lượng vẫn lớn. Đổi lại là yêu cầu bộ nhớ. Để phục vụ mô hình, cả 501B tham số vẫn phải nằm trong bộ nhớ GPU.

Reflection cho biết cơ chế định tuyến của mình cân bằng bất thường: vào cuối giai đoạn tiền huấn luyện, chuyên gia có tải cao nhất chỉ nhận tải gấp 1.04× mức trung bình, nhờ đó mọi chuyên gia đều được sử dụng.

501B100%
23B4.6%

Beam được huấn luyện như thế nào

Tiền huấn luyện

23.8 nghìn tỷ token từ web, các nguồn công khai và tập dữ liệu được cấp phép, tập trung nhiều vào mã, văn bản kỹ thuật và STEM. Khoảng 95% token web thô đã bị lọc bỏ. Huấn luyện trên 6,144 GPU NVIDIA GB300 NVL72 trong chưa đầy bốn tuần, với goodput đạt 92.3% vào giai đoạn cuối.

Huấn luyện giữa kỳ

Giai đoạn được thiết kế để chuẩn bị mô hình cho học tăng cường: tài liệu dài giàu nội dung suy luận, kho mã và các tác vụ có chân trời dài. Đây là giai đoạn mở rộng ngữ cảnh hiệu dụng của Beam lên 1 triệu token.

Học tăng cường

Hơn 100 triệu lượt rollout trên 10,500 GPU GB300 trong bốn tuần, qua gần một triệu môi trường lập trình, tác nhân và STEM, cùng khoảng 1.3 tỷ sandbox. Reflection gọi đây là một trong những đợt huấn luyện RL lớn nhất của bất kỳ phòng thí nghiệm mở nào, đồng thời cho biết điểm số vẫn tăng khi đợt huấn luyện kết thúc.

An toàn và căn chỉnh

Một mô hình an toàn và căn chỉnh riêng được huấn luyện từ cùng mô hình nền, rồi hợp nhất với mô hình RL thông qua chưng cất on-policy đa giáo viên. Reflection cho biết sẽ công bố các đánh giá an toàn trong báo cáo kỹ thuật và mã nguồn mở các bài đánh giá an toàn nội bộ.

Mức độ suy luận và hiệu quả sử dụng token

Beam được huấn luyện bằng một hình phạt độ dài, khuyến khích câu trả lời đúng và hạn chế token không cần thiết. Trong API, bạn chọn mức độ suy luận: cài đặt thấp hơn trả lời nhanh hơn với ít token hơn, còn cài đặt cao hơn sẽ suy nghĩ lâu hơn về các vấn đề khó.

Beam cần bao nhiêu bộ nhớ?

Reflection chưa công bố yêu cầu phần cứng. Đây là ước tính sơ bộ của chúng tôi chỉ dành cho trọng số (số tham số × số byte mỗi tham số). Triển khai thực tế cần thêm bộ nhớ cho bộ nhớ đệm KV và các giá trị kích hoạt.

Độ chính xácChỉ trọng sốPhần cứng ví dụ
BF16 / FP16≈ 1.002 GB8× GPU 192 GB (khoảng 1.5 TB) hoặc cụm nhiều nút
FP8≈ 501 GB8× GPU 80 GB sẽ khá sát giới hạn; 8× 141 GB trở lên sẽ thoải mái
INT4 / 4-bit≈ 251 GBTối thiểu 4× GPU 80 GB, cần nhiều hơn nếu dùng ngữ cảnh dài

Đây là các ước tính, không phải yêu cầu chính thức. Chúng tôi sẽ thay bằng số liệu của Reflection khi thẻ mô hình được phát hành.