ข้ามไปยังเนื้อหา
reflectionbeam

model card

ข้อมูลจำเพาะของ Beam

ข้อมูลทั้งหมดที่ Reflection AI เผยแพร่เกี่ยวกับการสร้างและฝึก Beam ตัวเลขมาจากประกาศอย่างเป็นทางการและเอกสารสำหรับนักพัฒนา ส่วนค่าประมาณจะระบุไว้ชัดเจน

ภาพรวม

ผู้พัฒนาReflection AI (New York)
ประกาศเมื่อ2026-10-05
ประเภทโมเดลโมเดลภาษาสถาปัตยกรรม Mixture-of-Experts แบบเบาบาง
พารามิเตอร์ทั้งหมด501B
พารามิเตอร์ที่ใช้งานต่อโทเคน23B
เลเยอร์52
กลไกความสนใจกลไกความสนใจเฉพาะที่และทั่วโลกแบบสลับกัน
หน้าต่างบริบท (API เบตา)256K tokens
ความยาวบริบทที่ทำได้ระหว่างการฝึกช่วงกลาง1M tokens
เอาต์พุตสูงสุด (API)128K tokens
วันตัดข้อมูลความรู้2026-06-30
รูปแบบข้อมูลรับข้อความ ส่งข้อความ
การให้เหตุผลเปิดใช้งานตลอด พร้อมตั้งค่าความพยายามในการให้เหตุผล
ฟีเจอร์ APIเรียกใช้เครื่องมือ เอาต์พุตแบบมีโครงสร้าง และสตรีมมิง
ใบอนุญาตของน้ำหนักโมเดลApache 2.0 (ให้คำมั่นว่าจะเปิดเผย weights ในช่วงปลายเดือนตุลาคม 2026)
รหัสโมเดล APIBeam-501B-A23B

ทำไมมีพารามิเตอร์ทั้งหมด 501B แต่เปิดใช้งานเพียง 23B?

ในโมเดล Mixture-of-Experts แต่ละเลเยอร์มีเครือข่าย “ผู้เชี่ยวชาญ” ขนาดเล็กจำนวนมาก และ router จะเลือกบางเครือข่ายสำหรับแต่ละ token Beam มีพารามิเตอร์ 501 พันล้านตัว แต่แต่ละ token จะผ่านพารามิเตอร์เหล่านั้นเพียงประมาณ 23 พันล้านตัว

ผลลัพธ์คือการคำนวณต่อ token ใกล้เคียงกับโมเดล dense ขนาด 23B ทำให้ให้บริการ Beam ได้ในต้นทุนต่ำลง ขณะที่ยังคงความจุโดยรวมไว้ได้มาก ข้อแลกเปลี่ยนคือหน่วยความจำ พารามิเตอร์ทั้ง 501B ยังคงต้องอยู่ในหน่วยความจำ GPU เพื่อให้บริการโมเดล

Reflection ระบุว่าการจัดสรรเส้นทางของโมเดลมีความสมดุลเป็นพิเศษ โดยเมื่อสิ้นสุดการ pretraining ผู้เชี่ยวชาญที่มีโหลดสูงที่สุดมีโหลดเพียง 1.04× ของค่าเฉลี่ย ดังนั้นผู้เชี่ยวชาญทุกตัวจึงถูกใช้งาน

501B100%
23B4.6%

Beam ผ่านการฝึกอย่างไร

Pretraining

ฝึกด้วย 23.8 ล้านล้าน token จากเว็บ แหล่งข้อมูลสาธารณะ และชุดข้อมูลที่ได้รับอนุญาต โดยเน้นโค้ด งานเขียนเชิงเทคนิค และ STEM อย่างมาก คัดกรอง token จากเว็บดิบออกประมาณ 95% ฝึกบน NVIDIA GB300 NVL72 จำนวน 6,144 GPU ภายในเวลาไม่ถึงสี่สัปดาห์ โดยมี goodput 92.3% ในช่วงท้าย

Midtraining

ขั้นตอนที่ออกแบบมาเพื่อเตรียมโมเดลสำหรับการเรียนรู้แบบเสริมกำลัง โดยใช้เอกสารที่มีเนื้อหาเชิงเหตุผลยาว ๆ คลังโค้ด และงานที่ต้องทำต่อเนื่องเป็นเวลานาน ในขั้นตอนนี้เองที่ขยาย context ที่ใช้งานได้ของ Beam เป็น 1 ล้าน token

การเรียนรู้แบบเสริมกำลัง

ทำ rollouts มากกว่า 100 ล้านครั้งบน GPU GB300 จำนวน 10,500 ตัว เป็นเวลาสี่สัปดาห์ ครอบคลุมสภาพแวดล้อมด้านการเขียนโค้ด การทำงานแบบเอเจนต์ และ STEM เกือบหนึ่งล้านรายการ รวมถึง sandbox ประมาณ 1.3 พันล้านแห่ง Reflection เรียกการฝึกนี้ว่าเป็นหนึ่งในรอบ RL ที่ใหญ่ที่สุดของแล็บอิสระใด ๆ และระบุว่าคะแนนยังเพิ่มขึ้นอยู่เมื่อการฝึกสิ้นสุดลง

ความปลอดภัยและการจัดแนว

ฝึกโมเดลด้านความปลอดภัยและการจัดแนวแยกต่างหากจาก base model เดียวกัน แล้วนำมารวมกับโมเดล RL ผ่านการกลั่นความรู้แบบ on-policy จากครูหลายโมเดล Reflection ระบุว่าจะเผยแพร่ผลการประเมินด้านความปลอดภัยในรายงานทางเทคนิค และเปิดซอร์สการประเมินความปลอดภัยภายใน

ความพยายามในการให้เหตุผลและประสิทธิภาพการใช้ token

Beam ผ่านการฝึกด้วยบทลงโทษตามความยาว ซึ่งให้รางวัลกับคำตอบที่ถูกต้องและลดแรงจูงใจในการใช้ token โดยไม่จำเป็น ใน API คุณเลือกความพยายามในการให้เหตุผลได้ โดยค่าต่ำจะตอบเร็วขึ้นและใช้ token น้อยลง ส่วนค่าสูงจะใช้เวลาคิดกับโจทย์ยากนานขึ้น

Beam ต้องใช้หน่วยความจำเท่าไร?

Reflection ยังไม่ได้เผยแพร่ข้อกำหนดด้านฮาร์ดแวร์ นี่คือค่าประมาณคร่าว ๆ ของเราเฉพาะ weights (จำนวนพารามิเตอร์ × ไบต์ต่อพารามิเตอร์) การติดตั้งใช้งานจริงต้องใช้หน่วยความจำเพิ่มเติมสำหรับ KV cache และ activations

ความละเอียดเฉพาะ weightsฮาร์ดแวร์ตัวอย่าง
BF16 / FP16≈ 1,002 GBGPU 8× 192 GB (ประมาณ 1.5 TB) หรือคลัสเตอร์หลายโหนด
FP8≈ 501 GBGPU 8× 80 GB ใช้งานได้ค่อนข้างจำกัด; 8× 141 GB ขึ้นไปใช้งานได้สบาย
INT4 / 4-bit≈ 251 GBGPU 80 GB อย่างน้อย 4 ตัว และต้องใช้มากกว่านี้เมื่อมีบริบทยาว

เป็นเพียงการประมาณการ ไม่ใช่ข้อกำหนดอย่างเป็นทางการ เราจะเปลี่ยนเป็นตัวเลขจาก Reflection เมื่อมีการเผยแพร่การ์ดโมเดล