Arcee AI là một công ty nhỏ chỉ với 26 người, nhưng họ vừa làm một điều khiến nhiều người trong ngành bất ngờ: chi khoảng một nửa số vốn đầu tư mạo hiểm của công ty, 20 triệu USD, sử dụng 2048 GPU Nvidia B300 trong 33 ngày, để huấn luyện một mô hình suy luận mã nguồn mở với 40 tỷ tham số có tên là Trinity-Large-Thinking.
Hiệu suất tác vụ Agent của mô hình khá ấn tượng: đạt hạng nhất (88 điểm) trên chuẩn Tau2-Airline, hạng nhì (91,9 điểm) trên PinchBench (Claude Opus 4.6 của Anthropic đạt 93,3 điểm), và đạt 96,3 điểm trên AIME25 về suy luận toán học. Toàn bộ được phát hành theo giấy phép mã nguồn mở Apache 2.0, có thể sử dụng thương mại, tải xuống và chỉnh sửa.
Không phải "càng mạnh càng tốt", mà là tận dụng tối đa kiến trúc MoE
Trinity-Large-Thinking là một mô hình hỗn hợp chuyên gia (MoE) với tổng số 40 tỷ tham số, nhưng mỗi lần suy luận chỉ kích hoạt khoảng 1,3 tỷ tham số — sử dụng 256 chuyên gia, mỗi lần chỉ chọn 4 để kích hoạt. Điều này có nghĩa là mô hình có "kho kiến thức" của một mô hình lớn, nhưng tốc độ suy luận và mức tiêu thụ tài nguyên lại gần với một mô hình nhỏ.
Dữ liệu huấn luyện là 17 nghìn tỷ token, trong đó hơn 8 nghìn tỷ được tạo tổng hợp. Tỷ lệ này đã trở nên phổ biến trong các mô hình mã nguồn mở chất lượng cao hiện nay.
Điểm nổi bật hơn về mặt kỹ thuật là thuật toán SMEBU (Soft-clamped Momentum Expert Bias Updates) do họ tự phát triển, được thiết kế để giải quyết vấn đề "sụp đổ chuyên gia" trong huấn luyện MoE quy mô lớn. Toàn bộ quá trình huấn luyện 17 nghìn tỷ token "không có một đỉnh mất mát nào" — điều này rất hiếm trong huấn luyện mô hình lớn, vì nhiều mô hình MoE thường gặp phải sự bùng nổ mất mát đột ngột ở giữa quá trình.
Điểm mạnh và điểm yếu
Thành thật mà nói, Trinity-Large-Thinking không vượt trội hoàn toàn so với Claude Opus, nhưng nó đã tạo ra đột phá trong các tình huống cụ thể.
| Chuẩn | Trinity-Large-Thinking | Claude Opus 4.6 |
|---|---|---|
| Tau2-Airline | 88 (hạng nhất) | Chưa công bố |
| PinchBench | 91,9 (hạng nhì) | 93,3 |
| AIME25 | 96,3 | — |
| GPQA-Diamond | 76,3 | 89,2 |
| MMLU-Pro | 83,4 | 89,1 |
Hiệu suất tác vụ Agent có thể tiệm cận mức hàng đầu, nhưng suy luận tổng quát vẫn còn khoảng cách khoảng 13 điểm phần trăm. Tuy nhiên, xét đến đây là mô hình mã nguồn mở và có thể triển khai cục bộ, khoảng cách này đã là rất nhỏ.
Ngoài ra, họ cũng đồng thời phát hành Trinity-Large-TrueBase — một phiên bản "điểm kiểm tra gốc" giữ lại trạng thái tiền huấn luyện thuần túy trước khi tinh chỉnh hướng dẫn. Phiên bản này rất có giá trị đối với những người nghiên cứu AI cơ bản, giúp họ nghiên cứu tác động cụ thể của RLHF và tinh chỉnh hướng dẫn lên hành vi của mô hình.
Bối cảnh lớn hơn: Sự vắng mặt kéo dài của AI mã nguồn mở Mỹ
Trong năm qua, bảng xếp hạng các mô hình lớn mã nguồn mở chủ yếu là sân chơi của các công ty Trung Quốc: DeepSeek, Qwen, Kimi, GLM, cứ vài tháng lại có một mô hình mới xuất hiện. Về phía Mỹ, chỉ có Llama của Meta là trụ cột duy nhất, nhưng gần đây Meta đã đóng cửa một số mô hình mới, khiến cộng đồng mã nguồn mở không hài lòng. Arcee lần này lấp đầy khoảng trống đó.
CEO Mark McQuade cho biết mục tiêu của mô hình này là các doanh nghiệp: có thể triển khai cục bộ, có thể tùy chỉnh, và không cần gửi dữ liệu cho các nhà cung cấp dịch vụ đám mây. Đối với các tổ chức tài chính, y tế và chính phủ có yêu cầu tuân thủ dữ liệu, tính năng "có thể chạy trên máy chủ của riêng mình" đôi khi còn hữu ích hơn cả điểm số benchmark.
26 người, 20 triệu USD, 33 ngày, 40 tỷ tham số.
Chuyện công ty nhỏ làm việc lớn vẫn chưa chết trong giới AI.
Nguồn tham khảo: Arcee AI spent half its venture capital to build an open reasoning model that rivals Claude Opus in agent tasks (The Decoder); Tiny startup Arcee AI built a 400B-parameter open source LLM from scratch to best Meta's Llama (TechCrunch); CocoLoop; Arcee aims to reboot U.S. open source AI with new Trinity models released under Apache 2.0 (VentureBeat)