İçeriğe geç
reflectionbeam

Model kartı

Beam özellikleri

Reflection AI'nin Beam'in nasıl geliştirildiği ve eğitildiği hakkında yayımladığı her şey. Rakamlar resmi duyuru ve geliştirici belgelerinden alınmıştır; tahminler belirtilmiştir.

Genel bakış

GeliştiriciReflection AI (New York)
Duyurulma tarihi2026-10-05
Model türüSeyrek Uzman Karışımı dil modeli
Toplam parametre sayısı501B
Token başına etkin parametre sayısı23B
Katman sayısı52
Dikkat mekanizmasıDönüşümlü yerel ve küresel dikkat
Bağlam penceresi (API beta)256K tokens
Eğitimin orta aşamasında ulaşılan bağlam uzunluğu1M tokens
Maksimum çıktı (API)128K tokens
Bilgi kesim tarihi2026-06-30
Girdi/çıktı türüMetin girişi, metin çıktısı
Akıl yürütmeHer zaman açık; akıl yürütme çabası ayarı
API özellikleriAraç çağrısı, yapılandırılmış çıktılar, akış
Ağırlık lisansıApache 2.0 (ağırlıkların Ekim 2026'nın ilerleyen günlerinde yayımlanacağı taahhüt edildi)
API model kimliğiBeam-501B-A23B

Toplam 501B, ama etkin parametre sayısı neden 23B?

Uzman Karışımı modelinde her katmanda çok sayıda küçük “uzman” ağı bulunur ve bir yönlendirici her token için bunlardan birkaçını seçer. Beam 501 milyar parametre içerir, ancak her token bu parametrelerin yalnızca yaklaşık 23 milyarından geçer.

Sonuç: Token başına hesaplama, 23B yoğun bir modelinkine yakındır; bu da toplam kapasite büyük kalırken Beam'in sunulmasını daha ucuz hâle getirir. Dezavantajı ise bellektir. Modeli sunmak için 501B parametrenin tamamının GPU belleğinde bulunması gerekir.

Reflection, yönlendirme dağılımının alışılmadık ölçüde dengeli olduğunu söylüyor: ön eğitimin sonunda en yoğun kullanılan uzmanın yükü, ortalama yükün yalnızca 1.04×'ü kadardı; yani tüm uzmanlar kullanılıyor.

501B100%
23B4.6%

Beam nasıl eğitildi?

Ön eğitim

Web'den, kamuya açık kaynaklardan ve lisanslı veri kümelerinden 23.8 trilyon token; kod, teknik yazım ve STEM'e özellikle ağırlık verildi. Ham web tokenlarının yaklaşık %95'i filtrelendi. 6,144 NVIDIA GB300 NVL72 GPU'da dört haftadan kısa sürede çalıştırıldı; sürecin sonlarına doğru goodput %92.3'e ulaştı.

Ara eğitim

Modeli pekiştirmeli öğrenmeye hazırlamak için tasarlanmış bir aşama: muhakeme açısından zengin uzun belgeler, kod depoları ve uzun vadeli görevler. Beam'in etkin bağlamının 1 milyon tokena çıkarıldığı aşama budur.

Pekiştirmeli öğrenme

Dört hafta boyunca 10,500 GB300 GPU'da, yaklaşık bir milyon kodlama, ajan tabanlı ve STEM ortamında ve yaklaşık 1.3 milyar sandbox üzerinde 100 milyondan fazla rollout gerçekleştirildi. Reflection bunu açık bir laboratuvar tarafından yürütülen en büyük pekiştirmeli öğrenme çalışmalarından biri olarak nitelendiriyor ve çalışma sona erdiğinde puanların hâlâ yükseldiğini söylüyor.

Güvenlik ve hizalama

Aynı temel modelden ayrı bir güvenlik ve hizalama modeli eğitildi, ardından çok öğretmenli on-policy damıtma yoluyla pekiştirmeli öğrenme modeliyle birleştirildi. Reflection, teknik raporda güvenlik değerlendirmelerini yayımlayacağını ve kurum içi güvenlik değerlendirmelerini açık kaynaklı hâle getireceğini söylüyor.

Akıl yürütme çabası ve token verimliliği

Beam, doğru yanıtları ödüllendiren ve gereksiz token kullanımını caydıran bir uzunluk cezasıyla eğitildi. API'de bir akıl yürütme çabası düzeyi seçebilirsiniz: düşük ayarlar daha az token kullanarak daha hızlı yanıt verir; yüksek ayarlar ise zor problemlerde daha uzun düşünür.

Beam ne kadar bellek gerektiriyor?

Reflection henüz donanım gereksinimlerini yayımlamadı. Bunlar yalnızca ağırlıklar için kaba tahminlerimizdir (parametre sayısı × parametre başına bayt). Gerçek dağıtımlarda KV önbelleği ve etkinleştirmeler için ek bellek gerekir.

HassasiyetYalnızca ağırlıklarÖrnek donanım
BF16 / FP16≈ 1.002 GB8× 192 GB GPU (yaklaşık 1.5 TB) veya çok düğümlü bir küme
FP8≈ 501 GB8× 80 GB GPU yetersiz kalabilir; 8× 141 GB veya daha fazlası rahatça yeter
INT4 / 4-bit≈ 251 GBEn az 4× 80 GB GPU; uzun bağlamlar için daha fazlası

Bunlar tahmindir, resmi gereksinimler değildir. Model kartı yayımlandığında bunları Reflection'ın değerleriyle değiştireceğiz.