Chuyển đến nội dung
reflectionbeam

Đối đầu

Beam vs DeepSeek V4.1 Flash

2:7

Beam thắng 2 trên tổng số 9 benchmark chung

Kết luận

DeepSeek V4.1 Flash dẫn trước ở 7 trong 9 benchmark chung, với khoảng cách lớn ở DeepSWE và AutomationBench, cùng mức dẫn trước 10 điểm trên Terminal-Bench. Beam thắng ở CritPt và có chỉ số AA Omniscience tốt hơn, vốn trừ điểm cho các câu trả lời sai nhưng được khẳng định chắc chắn. Xét về hiệu quả, Beam không có lợi thế trong trường hợp này: DeepSeek V4.1 Flash chỉ kích hoạt 16 tỷ tham số cho mỗi token được tạo ra, ít hơn 23 tỷ của Beam, và trọng số của mẫu này đã được công khai theo giấy phép MIT.

So sánh từng benchmark

BenchmarkBeamDeepSeek V4.1 FlashChênh lệch
DeepSWE v1.144,474,2-29,8
Terminal-Bench v2.180,190,6-10,5
Humanity's Last Exam (no tools)36,239,1-2,9
SciCode49,752,0-2,3
CritPt (AA)16,314,3+2,0
GPQA Diamond90,590,9-0,4
AutomationBench (public)37,054,8-17,8
AA-LCR (long context)79,384,0-4,7
AA Omniscience index (public split)13,06,6+6,4

Tất cả điểm số đều lấy từ thông báo của Reflection (bản cập nhật October 8, 2026). Điểm số của DeepSeek V4.1 Flash là số liệu Reflection trích dẫn từ Artificial Analysis và DataCurve.

Hai mô hình

BeamDeepSeek V4.1 Flash
Nhà phát triểnReflection AIDeepSeek
Có trụ sở tạiHoa KỳTrung Quốc
Tham số (tổng / đang hoạt động)501B / 23B552B / 16B
Trọng sốApache 2.0, được hứa hẹn ra mắt vào cuối October 2026MIT
Phát hành5 tháng 10, 202610 tháng 9, 2026
Cách truy cậpAPI beta theo danh sách chờ; trọng số sẽ ra mắt sauHugging Face, DeepSeek API, OpenRouter

Các so sánh khác