ข้ามไปยังเนื้อหา
reflectionbeam

เปรียบเทียบแบบตัวต่อตัว

Beam vs DeepSeek V4.1 Flash

2:7

Beam ชนะ 2 จาก 9 เบนช์มาร์กที่ใช้ร่วมกัน

บทสรุป

DeepSeek V4.1 Flash นำใน 7 จาก 9 เบนช์มาร์กร่วม โดยทิ้งห่างมากใน DeepSWE และ AutomationBench และนำ Terminal-Bench อยู่ 10 คะแนน Beam ชนะใน CritPt และมีดัชนี AA Omniscience ที่ดีกว่า ซึ่งใช้ลงโทษคำตอบที่ผิดแต่มั่นใจเกินไป ด้านประสิทธิภาพ Beam ไม่ได้เปรียบในกรณีนี้: DeepSeek V4.1 Flash ใช้พารามิเตอร์เพียง 16 พันล้านตัวต่อโทเค็นที่สร้างขึ้น ซึ่งน้อยกว่า Beam ที่ใช้ 23 พันล้านตัว และมีการเผยแพร่น้ำหนักโมเดลต่อสาธารณะแล้วภายใต้ MIT

แยกตามเบนช์มาร์ก

BenchmarkBeamDeepSeek V4.1 Flashส่วนต่าง
DeepSWE v1.144.474.2-29.8
Terminal-Bench v2.180.190.6-10.5
Humanity's Last Exam (no tools)36.239.1-2.9
SciCode49.752.0-2.3
CritPt (AA)16.314.3+2.0
GPQA Diamond90.590.9-0.4
AutomationBench (public)37.054.8-17.8
AA-LCR (long context)79.384.0-4.7
AA Omniscience index (public split)13.06.6+6.4

คะแนนทั้งหมดมาจากประกาศของ Reflection (ฉบับปรับปรุงวันที่ 8 ตุลาคม 2026) คะแนนของ DeepSeek V4.1 Flash อ้างอิงตามที่ Reflection ระบุจาก Artificial Analysis และ DataCurve

โมเดลทั้งสอง

BeamDeepSeek V4.1 Flash
ผู้พัฒนาReflection AIDeepSeek
ตั้งอยู่ที่สหรัฐอเมริกาจีน
พารามิเตอร์ (ทั้งหมด / ที่ใช้งาน)501B / 23B552B / 16B
น้ำหนักโมเดลApache 2.0 โดยสัญญาว่าจะเปิดให้ใช้ภายหลังในเดือนตุลาคม 2026MIT
เปิดตัว5 ตุลาคม 256910 กันยายน 2569
วิธีเข้าถึงAPI เบตาที่ต้องเข้าคิวรอ; จะเปิดให้ใช้น้ำหนักโมเดลเร็ว ๆ นี้Hugging Face, DeepSeek API, OpenRouter

การเปรียบเทียบอื่น ๆ

แหล่งที่มา