انتقل إلى المحتوى
reflectionbeam

بطاقة النموذج

مواصفات Beam

كل ما نشرته Reflection AI عن بناء Beam وتدريبه. الأرقام مأخوذة من الإعلان الرسمي ووثائق المطورين؛ وقد وُضعت علامة على التقديرات.

نظرة سريعة

المطوّرReflection AI (New York)
تاريخ الإعلان2026-10-05
نوع النموذجنموذج لغوي بتوليفة خبراء متفرقة
إجمالي المعلمات501B
المعلمات النشطة لكل رمز23B
الطبقات52
الانتباهانتباه محلي وعالمي متداخل
نافذة السياق (إصدار تجريبي من API)256K tokens
طول السياق الذي بلغه النموذج في منتصف التدريب1M tokens
الحد الأقصى للإخراج (API)128K tokens
تاريخ انتهاء المعرفة2026-06-30
الوسائطنص للإدخال، ونص للإخراج
الاستدلاليعمل دائمًا، مع إعداد لجهد الاستدلال
ميزات APIاستدعاء الأدوات، ومخرجات منظّمة، وبثّ مباشر
ترخيص الأوزانApache 2.0 (وُعد بإتاحة الأوزان لاحقًا في October 2026)
معرّف نموذج APIBeam-501B-A23B

لماذا يبلغ الإجمالي 501B بينما النشط 23B؟

في نموذج مزيج الخبراء، تضم كل طبقة العديد من شبكات «الخبراء» الصغيرة، ويختار موجّهٌ عددًا قليلًا منها لكل رمز. يخزّن Beam ‏501 مليار معلمة، لكن كل رمز يمر عبر نحو 23 مليارًا منها فقط.

النتيجة: يقترب الحوسبة لكل رمز من نموذج كثيف بحجم 23B، ما يجعل تشغيل Beam أقل تكلفة، فيما تظل السعة الإجمالية كبيرة. لكن ثمة جانبًا سلبيًا: الذاكرة. فما زال لا بد من وضع المعلمات الـ501B كلها في ذاكرة GPU لتشغيل النموذج.

تقول Reflection إن التوجيه لديها متوازن على نحو استثنائي: ففي نهاية التدريب المسبق، لم يتجاوز الحمل على الخبير الأكثر انشغالًا 1.04× متوسط الحمل، لذا يُستخدم جميع الخبراء.

501B100%
23B4.6%

كيف تم تدريب Beam

التدريب المسبق

23.8 تريليون رمز من الويب والمصادر العامة ومجموعات البيانات المرخّصة، مع تركيز كبير على الشيفرات والكتابة التقنية والعلوم والتقنية والهندسة والرياضيات. جرى استبعاد نحو 95% من رموز الويب الخام. شُغّل التدريب على 6,144 وحدة معالجة رسومية NVIDIA GB300 NVL72 في أقل من أربعة أسابيع، مع معدل إنجاز فعلي بلغ 92.3% قرب النهاية.

التدريب الوسيط

مرحلة تهدف إلى إعداد النموذج للتعلّم المعزّز: مستندات طويلة غنية بالاستدلال، ومستودعات شيفرات، ومهام ذات أفق زمني طويل. في هذه المرحلة، وُسّع السياق الفعلي لـ Beam إلى مليون رمز.

التعلّم المعزّز

أكثر من 100 مليون عملية rollout على 10,500 وحدة معالجة رسومية GB300 على مدى أربعة أسابيع، عبر ما يقرب من مليون بيئة للبرمجة والمهام الوكيلة والعلوم والتقنية والهندسة والرياضيات، ونحو 1.3 مليار بيئة معزولة. تصف Reflection هذه العملية بأنها إحدى أكبر عمليات تشغيل التعلّم المعزّز التي نفّذها أي مختبر مفتوح، وتقول إن النتائج كانت لا تزال تتحسّن عند انتهائها.

السلامة والمواءمة

دُرّب نموذج منفصل للسلامة والمواءمة انطلاقًا من النموذج الأساسي نفسه، ثم دُمج مع نموذج التعلّم المعزّز عبر التقطير متعدد المعلمين باتباع السياسة. وتقول Reflection إنها ستنشر تقييمات السلامة في التقرير التقني، وستفتح المصدر لتقييمات السلامة الداخلية لديها.

جهد الاستدلال وكفاءة الرموز

دُرّب Beam باستخدام عقوبة على طول الإجابة تكافئ الإجابات الصحيحة وتثني عن استخدام الرموز غير الضرورية. في API، تختار جهد الاستدلال: الإعدادات الأقل تجيب أسرع وبعدد أقل من الرموز، بينما تمنح الإعدادات الأعلى وقتًا أطول للتفكير في المسائل الصعبة.

ما مقدار الذاكرة التي يحتاجها Beam؟

لم تنشر Reflection متطلبات الأجهزة بعد. هذه تقديراتنا التقريبية للأوزان وحدها (عدد المعلمات × البايتات لكل معلمة). تحتاج عمليات النشر الفعلية إلى ذاكرة إضافية لذاكرة التخزين المؤقت KV وعمليات التنشيط.

الدقةالأوزان فقطمثال على الأجهزة
BF16 / FP16≈ 1,002 GB8× وحدات GPU بسعة 192 GB (نحو 1.5 TB) أو مجموعة متعددة العُقد
FP8≈ 501 GB8× وحدات GPU بسعة 80 GB خيار صعب؛ أما 8× بسعة 141 GB أو أكثر فتوفّر سعة مريحة
INT4 / 4-bit≈ 251 GB4× 80 GB من وحدات GPU كحد أدنى، والمزيد للسياقات الطويلة

هذه تقديرات وليست متطلبات رسمية. سنستبدلها بأرقام Reflection عند صدور بطاقة النموذج.