المعايير
نتائج Beam في الاختبارات المعيارية
21 اختبارًا معياريًا تغطي البرمجة الوكيلة والاستدلال واستخدام الأدوات والمهارات العامة، تمامًا كما نشرتها Reflection، إلى جانب سبعة نماذج مفتوحة أخرى.
هذه أرقام أبلغت عنها الشركة في إعلان Reflection (حُدّث الجدول في 8 أكتوبر 2026). أما نتائج النماذج الأخرى فمن Artificial Analysis وDataCurve، كما أشارت Reflection. وستتبعها عمليات تحقق مستقلة بعد إتاحة الأوزان للعامة.
| المعيار | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | — | — | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE-Bench Pro v2-Hard | 77.2 | 56.9 | — | — | 84.3 | 88.2 | — | — |
| SWE-Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | — | — | 67.7 | — |
| Terminal-Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | — | — | — | 61.0 | 68.0 | — | — |
| SWE-Bench Multilingual | 78.0 | — | 67.7 | — | — | — | — | — |
| SWE-Bench Verified | 80.9 | 77.6 | 70.7 | — | — | — | — | — |
| AIME 2026 | 97.8 | 97.1 | — | 99.2 | — | — | — | — |
| Humanity's Last Exam (no tools) | 36.2 | 29.7 | 26.7 | 40.5 | 42.3 | 46.9 | 43.6 | 39.1 |
| SciCode | 49.7 | 46.1 | 44.6 | — | 59.0 | 58.7 | 52.1 | 52.0 |
| CritPt (AA) | 16.3 | 5.4 | 3.1 | 20.9 | 19.1 | 23.4 | 20.0 | 14.3 |
| GPQA Diamond | 90.5 | 87.2 | 87.0 | 91.2 | 91.7 | 93.5 | 92.6 | 90.9 |
| AutomationBench (public) | 37.0 | — | — | 26.2 | 48.2 | 46.7 | 39.8 | 54.8 |
| MCP Atlas | 78.7 | 76.0 | 63.1 | 77.8 | 84.2 | 82.3 | 84.5 | — |
| τ³ banking | 38.0 | 25.0 | 22.6 | 37.1 | — | 37.1 | 55.2 | — |
| BrowseComp (context mgmt) | 77.4 | 77.1 | 44.4 | — | — | 91.2 | — | — |
| DeepSearchQA (context mgmt) | 80.1 | — | — | — | — | 95.0 | — | — |
| AA-LCR (long context) | 79.3 | 77.3 | 79.3 | 78.3 | 79.7 | 88.7 | 80.3 | 84.0 |
| LongBench v2 | 65.5 | — | 61.9 | 64.0 | — | — | 66.3 | — |
| IFBench | 79.7 | 79.8 | 81.7 | 73.3 | — | — | 82.8 | — |
| AA Omniscience index (public split) | 13.0 | 14.2 | 8.6 | — | 22.6 | — | — | 6.6 |
00.0 أفضل نتيجة مُعلنة في الصف— لم يُذكر
ما الذي تكشفه الأرقام
يتفوق Beam في هندسة البرمجيات. فقد سجل 80.9 في SWE-Bench Verified (متقدمًا على Inkling الذي سجل 77.6) و78.0 في SWE-Bench Multilingual (متقدمًا على Nemotron 3 Ultra الذي سجل 67.7)، وهما اختباران لم تُعلن النماذج الصينية الأكبر نتائج لهما. كما تفوق بفارق ضئيل على GLM 5.2 في SWE-Bench Pro v1 (65.5 مقابل 62.1) وفي MCP Atlas (78.7 مقابل 77.8).
في الاستدلال البحت، يأتي Beam متأخرًا قليلًا عن المتصدرين: سجل 90.5 في GPQA Diamond مقابل 93.5 لـKimi K3، و36.2 في Humanity's Last Exam من دون أدوات مقابل 46.9.
لا تقول Reflection إن Beam يتفوق في كل شيء، بل إنه يقترب من المتصدرين مع استهلاك قدرة حوسبة أقل بكثير لكل إجابة. وما زال Kimi K3 وGLM 5.3 وQwen 3.8 Max يتصدرون في معظم الصفوف التي أعلنوا نتائجها فيها.
ما الذي يقيسه كل اختبار معياري
البرمجة الوكيلة والطرفية
- DeepSWE v1.1
- مهام هندسة برمجيات طويلة الأمد يحلها وكيل من البداية إلى النهاية.
- SWE-Bench Pro v2-Hard
- المجموعة الأصعب من SWE-Bench Pro: مشكلات صعبة في مستودعات برمجية واقعية.
- SWE-Bench Pro v1
- مشكلات حقيقية من GitHub في قواعد برمجية احترافية، وهي أصعب وأقل عرضة لتلوث بيانات التدريب من SWE-Bench التقليدي.
- Terminal-Bench v2.1
- إنجاز المهام داخل طرفية Linux حقيقية: أوامر الصدفة والأدوات وعمليات البناء وتصحيح الأخطاء.
- SWE Atlas Codebase QnA
- الإجابة عن أسئلة حول قواعد شيفرة كبيرة وغير مألوفة.
- SWE-Bench Multilingual
- إصلاح المشكلات بأسلوب SWE-Bench عبر لغات برمجة متعددة.
- SWE-Bench Verified
- مجموعة فرعية من SWE-Bench تحقّق منها البشر: أصلح المشكلة بحيث تنجح الاختبارات المخفية.
الاستدلال
- AIME 2026
- مسائل من اختبار الرياضيات الأمريكي الدعوي لعام 2026.
- Humanity's Last Exam (no tools)
- أسئلة بمستوى الخبراء في مجالات متعددة من Humanity's Last Exam، مع الإجابة عنها دون أدوات.
- SciCode
- كتابة شيفرة لحل مسائل علمية بمستوى الأبحاث.
- CritPt (AA)
- مسائل في الاستدلال الفيزيائي بمستوى الأبحاث، كما تجريها Artificial Analysis.
- GPQA Diamond
- أسئلة في الأحياء والكيمياء والفيزياء بمستوى الدراسات العليا، صُممت لتصعب الإجابة عنها بالبحث.
استدعاء الأدوات والبحث
- AutomationBench (public)
- أتمتة سير عمل تجاري متعدد الخطوات عبر التطبيقات.
- MCP Atlas
- استخدام الأدوات المتاحة عبر بروتوكول سياق النماذج (MCP) على نحو صحيح.
- τ³ banking
- محادثات على نمط خدمة العملاء في مجال الخدمات المصرفية، باستخدام الأدوات والسياسات.
- BrowseComp (context mgmt)
- العثور على معلومات يصعب الوصول إليها عبر تصفح الويب، مع إدارة السياق.
- DeepSearchQA (context mgmt)
- أسئلة بحثية متعددة الخطوات تتطلب البحث ودمج المصادر.
القدرات العامة
- AA-LCR (long context)
- الاستدلال على مستندات طويلة جدًا (الاستدلال على سياق طويل من Artificial Analysis).
- LongBench v2
- فهم المدخلات الطويلة والإجابة عن الأسئلة المتعلقة بها.
- IFBench
- اتباع تعليمات دقيقة وقابلة للتحقق بشأن التنسيق والمحتوى.
- AA Omniscience index (public split)
- المعرفة الواقعية مع احتساب عقوبة على الإجابات الخاطئة الواثقة (الهلوسات).