انتقل إلى المحتوى
reflectionbeam

المعايير

نتائج Beam في الاختبارات المعيارية

21 اختبارًا معياريًا تغطي البرمجة الوكيلة والاستدلال واستخدام الأدوات والمهارات العامة، تمامًا كما نشرتها Reflection، إلى جانب سبعة نماذج مفتوحة أخرى.

هذه أرقام أبلغت عنها الشركة في إعلان Reflection (حُدّث الجدول في 8 أكتوبر 2026). أما نتائج النماذج الأخرى فمن Artificial Analysis وDataCurve، كما أشارت Reflection. وستتبعها عمليات تحقق مستقلة بعد إتاحة الأوزان للعامة.

المعيارBeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4——44.061.068.051.074.2
SWE-Bench Pro v2-Hard77.256.9——84.388.2——
SWE-Bench Pro v165.554.346.462.1——67.7—
Terminal-Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6———61.068.0——
SWE-Bench Multilingual78.0—67.7—————
SWE-Bench Verified80.977.670.7—————
AIME 202697.897.1—99.2————
Humanity's Last Exam (no tools)36.229.726.740.542.346.943.639.1
SciCode49.746.144.6—59.058.752.152.0
CritPt (AA)16.35.43.120.919.123.420.014.3
GPQA Diamond90.587.287.091.291.793.592.690.9
AutomationBench (public)37.0——26.248.246.739.854.8
MCP Atlas78.776.063.177.884.282.384.5—
τ³ banking38.025.022.637.1—37.155.2—
BrowseComp (context mgmt)77.477.144.4——91.2——
DeepSearchQA (context mgmt)80.1————95.0——
AA-LCR (long context)79.377.379.378.379.788.780.384.0
LongBench v265.5—61.964.0——66.3—
IFBench79.779.881.773.3——82.8—
AA Omniscience index (public split)13.014.28.6—22.6——6.6

00.0 أفضل نتيجة مُعلنة في الصف— لم يُذكر

ما الذي تكشفه الأرقام

يتفوق Beam في هندسة البرمجيات. فقد سجل 80.9 في SWE-Bench Verified (متقدمًا على Inkling الذي سجل 77.6) و78.0 في SWE-Bench Multilingual (متقدمًا على Nemotron 3 Ultra الذي سجل 67.7)، وهما اختباران لم تُعلن النماذج الصينية الأكبر نتائج لهما. كما تفوق بفارق ضئيل على GLM 5.2 في SWE-Bench Pro v1 (65.5 مقابل 62.1) وفي MCP Atlas (78.7 مقابل 77.8).

في الاستدلال البحت، يأتي Beam متأخرًا قليلًا عن المتصدرين: سجل 90.5 في GPQA Diamond مقابل 93.5 لـKimi K3، و36.2 في Humanity's Last Exam من دون أدوات مقابل 46.9.

لا تقول Reflection إن Beam يتفوق في كل شيء، بل إنه يقترب من المتصدرين مع استهلاك قدرة حوسبة أقل بكثير لكل إجابة. وما زال Kimi K3 وGLM 5.3 وQwen 3.8 Max يتصدرون في معظم الصفوف التي أعلنوا نتائجها فيها.

ما الذي يقيسه كل اختبار معياري

البرمجة الوكيلة والطرفية

DeepSWE v1.1
مهام هندسة برمجيات طويلة الأمد يحلها وكيل من البداية إلى النهاية.
SWE-Bench Pro v2-Hard
المجموعة الأصعب من SWE-Bench Pro: مشكلات صعبة في مستودعات برمجية واقعية.
SWE-Bench Pro v1
مشكلات حقيقية من GitHub في قواعد برمجية احترافية، وهي أصعب وأقل عرضة لتلوث بيانات التدريب من SWE-Bench التقليدي.
Terminal-Bench v2.1
إنجاز المهام داخل طرفية Linux حقيقية: أوامر الصدفة والأدوات وعمليات البناء وتصحيح الأخطاء.
SWE Atlas Codebase QnA
الإجابة عن أسئلة حول قواعد شيفرة كبيرة وغير مألوفة.
SWE-Bench Multilingual
إصلاح المشكلات بأسلوب SWE-Bench عبر لغات برمجة متعددة.
SWE-Bench Verified
مجموعة فرعية من SWE-Bench تحقّق منها البشر: أصلح المشكلة بحيث تنجح الاختبارات المخفية.

الاستدلال

AIME 2026
مسائل من اختبار الرياضيات الأمريكي الدعوي لعام 2026.
Humanity's Last Exam (no tools)
أسئلة بمستوى الخبراء في مجالات متعددة من Humanity's Last Exam، مع الإجابة عنها دون أدوات.
SciCode
كتابة شيفرة لحل مسائل علمية بمستوى الأبحاث.
CritPt (AA)
مسائل في الاستدلال الفيزيائي بمستوى الأبحاث، كما تجريها Artificial Analysis.
GPQA Diamond
أسئلة في الأحياء والكيمياء والفيزياء بمستوى الدراسات العليا، صُممت لتصعب الإجابة عنها بالبحث.

استدعاء الأدوات والبحث

AutomationBench (public)
أتمتة سير عمل تجاري متعدد الخطوات عبر التطبيقات.
MCP Atlas
استخدام الأدوات المتاحة عبر بروتوكول سياق النماذج (MCP) على نحو صحيح.
τ³ banking
محادثات على نمط خدمة العملاء في مجال الخدمات المصرفية، باستخدام الأدوات والسياسات.
BrowseComp (context mgmt)
العثور على معلومات يصعب الوصول إليها عبر تصفح الويب، مع إدارة السياق.
DeepSearchQA (context mgmt)
أسئلة بحثية متعددة الخطوات تتطلب البحث ودمج المصادر.

القدرات العامة

AA-LCR (long context)
الاستدلال على مستندات طويلة جدًا (الاستدلال على سياق طويل من Artificial Analysis).
LongBench v2
فهم المدخلات الطويلة والإجابة عن الأسئلة المتعلقة بها.
IFBench
اتباع تعليمات دقيقة وقابلة للتحقق بشأن التنسيق والمحتوى.
AA Omniscience index (public split)
المعرفة الواقعية مع احتساب عقوبة على الإجابات الخاطئة الواثقة (الهلوسات).