Lewati ke konten
reflectionbeam

Kartu model

Spesifikasi Beam

Semua informasi yang telah diterbitkan Reflection AI tentang cara Beam dibuat dan dilatih. Angka berasal dari pengumuman resmi dan dokumentasi developer; perkiraan diberi tanda.

Sekilas

DeveloperReflection AI (New York)
Diumumkan2026-10-05
Jenis modelModel bahasa Mixture-of-Experts yang jarang aktif
Total parameter501B
Parameter aktif per token23B
Lapisan52
Mekanisme perhatianMekanisme perhatian lokal dan global yang diselingi
Jendela konteks (beta API)256K tokens
Panjang konteks yang dicapai selama pelatihan tengah1M tokens
Output maksimum (API)128K tokens
Batas pengetahuan2026-06-30
ModalitasTeks masuk, teks keluar
PenalaranSelalu aktif, dengan pengaturan upaya penalaran
Fitur APIPemanggilan alat, keluaran terstruktur, streaming
Lisensi bobotApache 2.0 (bobot dijanjikan akan dirilis nanti pada Oktober 2026)
ID model APIBeam-501B-A23B

Mengapa total 501B, tetapi yang aktif 23B?

Dalam model Mixture-of-Experts, setiap lapisan memiliki banyak jaringan “ahli” kecil, lalu router memilih beberapa di antaranya untuk setiap token. Beam menyimpan 501 miliar parameter, tetapi setiap token hanya melewati sekitar 23 miliar parameter tersebut.

Hasilnya: komputasi per token mendekati model padat 23B. Inilah yang membuat biaya penyajian Beam lebih rendah, sementara kapasitas totalnya tetap besar. Konsekuensinya adalah kebutuhan memori. Untuk menyajikan model, semua 501B parameter tetap harus berada di memori GPU.

Reflection mengatakan bahwa peruteannya sangat seimbang: pada akhir prapelatihan, beban ahli tersibuk hanya 1,04× beban rata-rata, sehingga semua ahli digunakan.

501B100%
23B4.6%

Cara Beam dilatih

Prapelatihan

23,8 triliun token dari web, sumber publik, dan set data berlisensi, dengan penekanan kuat pada kode, tulisan teknis, dan STEM. Sekitar 95% token web mentah disaring. Pelatihan dijalankan pada 6.144 GPU NVIDIA GB300 NVL72 dalam waktu kurang dari empat minggu, dengan goodput 92,3% menjelang akhir.

Pelatihan menengah

Tahap yang dirancang untuk mempersiapkan model menghadapi pembelajaran penguatan: dokumen panjang yang kaya penalaran, repositori kode, dan tugas jangka panjang. Pada tahap inilah konteks efektif Beam diperluas hingga 1 juta token.

Pembelajaran penguatan

Lebih dari 100 juta rollout pada 10.500 GPU GB300 selama empat minggu, mencakup hampir satu juta lingkungan pemrograman, agen, dan STEM serta sekitar 1,3 miliar sandbox. Reflection menyebutnya sebagai salah satu pelatihan RL terbesar yang pernah dilakukan laboratorium terbuka mana pun, dan mengatakan bahwa skor masih meningkat saat pelatihan berakhir.

Keamanan dan penyelarasan

Model keamanan dan penyelarasan terpisah dilatih dari basis yang sama, lalu digabungkan dengan model RL melalui distilasi on-policy multi-guru. Reflection mengatakan bahwa mereka akan menerbitkan evaluasi keamanan dalam laporan teknis dan membuka evaluasi keamanan internalnya.

Upaya penalaran dan efisiensi token

Beam dilatih dengan penalti panjang yang memberi penghargaan untuk jawaban benar dan mencegah penggunaan token yang tidak perlu. Di API, Anda dapat memilih upaya penalaran: pengaturan yang lebih rendah menghasilkan jawaban lebih cepat dengan lebih sedikit token, sedangkan pengaturan yang lebih tinggi membuat model berpikir lebih lama untuk masalah sulit.

Berapa banyak memori yang dibutuhkan Beam?

Reflection belum menerbitkan persyaratan perangkat keras. Ini adalah perkiraan kasar kami untuk bobot saja (parameter × byte per parameter). Penerapan nyata memerlukan memori tambahan untuk cache KV dan aktivasi.

PresisiBobot sajaContoh perangkat keras
BF16 / FP16≈ 1.002 GB8× GPU 192 GB (sekitar 1,5 TB) atau klaster multi-node
FP8≈ 501 GB8× GPU 80 GB cukup mepet; 8× 141 GB atau lebih besar akan lebih leluasa
INT4 / 4-bit≈ 251 GBMinimal 4× GPU 80 GB, lebih banyak untuk konteks panjang

Ini perkiraan, bukan persyaratan resmi. Kami akan menggantinya dengan angka dari Reflection saat kartu model dirilis.