Reflection AI ra mắt Beam, mô hình mã nguồn mở 501 tỷ tham số

Reflection AI vừa phát hành mô hình mã nguồn mở trọng số đầu tiên của mình, mang tên Beam. Đây là mô hình hỗn hợp chuyên gia (MoE) dạng thưa với tổng cộng 501 tỷ tham số, trong đó 23 tỷ tham số được kích hoạt cho mỗi token, tập trung vào lập trình, suy luận và các tác vụ agent. Công ty cho biết trọng số, báo cáo kỹ thuật và model card sẽ được công bố vào cuối tháng này theo giấy phép Apache 2.0; mô hình hiện vẫn đang trong vòng kiểm thử đối kháng (red teaming) và đánh giá cuối cùng, nhưng các nhà phát triển đã có thể đăng ký trải nghiệm sớm tại platform.reflection.ai.

Reflection do các cựu nghiên cứu viên của DeepMind sáng lập và đã hoạt động âm thầm hơn một năm trước khi công bố. Vào tháng 6, công ty đã ký với SpaceX một hợp đồng năng lực tính toán trị giá tổng cộng khoảng 6,3 tỷ đô la, tương đương khoảng 150 triệu đô la mỗi tháng.

Beam được huấn luyện như thế nào

Theo blog chính thức, Beam có 52 lớp, và một giai đoạn huấn luyện giữa kỳ đã mở rộng cửa sổ ngữ cảnh lên 1 triệu token. Giai đoạn huấn luyện trước (pretraining) sử dụng 23,8 nghìn tỷ token, lấy từ các trang web công khai và các tập dữ liệu có giấy phép; token web thô được lọc theo nhiều tầng chất lượng, loại bỏ khoảng 95%.

Về năng lực tính toán, quá trình huấn luyện trước chạy trên 6.144 GPU Nvidia GB300 trong gần bốn tuần. Giai đoạn học tăng cường (RL) sau đó chuyển sang dùng 10.500 GPU GB300, chạy thêm bốn tuần nữa, tạo ra hơn 100 triệu rollout và sử dụng khoảng 1,3 tỷ môi trường sandbox. Reflection khá tự tin về quy mô của lần huấn luyện RL này:

"We believe this is one of the largest scale RL runs conducted by any open lab to date."

Nói cách khác, công ty cho rằng đây là một trong những lần huấn luyện học tăng cường có quy mô lớn nhất từng được một phòng thí nghiệm mở thực hiện cho đến nay. Blog cũng nói rằng khi năng lực tính toán cho RL tăng lên, các năng lực của mô hình tiếp tục tăng theo trên mọi mặt, "không thấy dấu hiệu chững lại".

So với các mô hình mã nguồn mở Trung Quốc

Các mô hình mà Reflection dùng để so sánh với Beam gần như toàn là mô hình Trung Quốc, và công ty không giấu điều này. Trong bảng so sánh chính thức, Beam ngang ngửa với GLM 5.2 của Zhipu AI, đồng thời tuyên bố chỉ dùng từ một phần tư đến một phần ba năng lực tính toán suy luận so với đối thủ; ở các tác vụ lập trình và agent, Beam được nói là tiếp cận gần Qwen 3.8-Max, một mô hình có hơn 2 nghìn tỷ tham số.

Một vài số liệu đáng chú ý:

BenchmarkBeamSo sánh
SWE-bench Verified80,9Inkling 77,6
Terminal Bench v2.180,1DeepSeek V4.1 Flash 90,6
SWE Bench Pro v2-Hard77,2Kimi K3 88,2
BrowseComp (có ngữ cảnh)77,4Kimi K3 91,2
GPQA Diamond90,5Kimi K3 93,5

Trong bảng này, Beam chỉ thắng ở một vài mục. Ở các tác vụ vận hành terminal, kỹ thuật phần mềm khó và tìm kiếm web, Kimi K3 và DeepSeek V4.1 Flash đều dẫn trước khoảng mười điểm. Điểm bán hàng chính của Reflection là hiệu suất: với 23 tỷ tham số được kích hoạt, một con số khá nhỏ so với mức điểm này, chi phí vận hành được cho là sẽ thấp hơn đáng kể.

Truyền thông phương Tây thường kể câu chuyện này theo hướng "lần đầu tiên một startup Mỹ tạo ra mô hình có thể đối đầu trực diện với các mô hình mã nguồn mở hàng đầu của Trung Quốc". Hơn một năm qua, vị trí đầu bảng xếp hạng mô hình mã nguồn mở gần như thuộc về DeepSeek, Qwen, Kimi và GLM; phía Mỹ, sau khi Meta chuyển trọng tâm sang dòng mô hình đóng Muse, số mô hình mở quy mô lớn đáng chú ý còn lại rất ít. Beam xuất hiện để lấp vào chỗ trống đó.

Những câu hỏi còn chưa có lời đáp

Tất cả các số liệu nêu trên đều đến từ các bài đánh giá nội bộ của Reflection; các chi tiết về cách thiết lập kiểm thử và số lần lấy mẫu phải chờ báo cáo kỹ thuật. Trọng số mô hình vẫn chưa được công bố, nên cộng đồng chưa thể tự kiểm chứng độc lập.

Blog không đưa ra bảng giá API nào, cũng không nói rõ mô hình sẽ ra mắt đầu tiên trên những nền tảng suy luận nào, mà chỉ đề cập sẽ hợp tác với các "đối tác phân phối trong hệ sinh thái". Giấy phép Apache 2.0 có nghĩa là sau khi trọng số được công bố, việc sử dụng thương mại và tinh chỉnh (fine-tuning) sẽ hoàn toàn tự do, nhưng yêu cầu bộ nhớ GPU để chạy đầy đủ 501 tỷ tham số vẫn rất cao — hầu hết các nhóm phát triển nhiều khả năng sẽ phải chờ các phiên bản lượng tử hóa hoặc dịch vụ lưu trữ từ bên thứ ba.

Nguồn: blog chính thức của Reflection AI, Latent Space, CocoLoop, SiliconANGLE; các số liệu về quy mô tham số, năng lực tính toán huấn luyện và điểm benchmark đều theo dữ liệu do Reflection AI công bố.