Vòng cạnh tranh tiếp theo của mô hình lớn có thể bắt đầu ở bộ đề, không phải bảng tham số.
Ngày 9 tháng 8, QbitAI đưa tin nhóm The Endless Frontier phát hành BigBang-V1. Mô hình được hậu huấn luyện từ Qwen3.6-35B-A3B, có 35B tham số tổng, khoảng 3B tham số kích hoạt khi suy luận và cửa sổ ngữ cảnh mặc định 262.144 token. Mô hình, mã nguồn và báo cáo kỹ thuật đã công khai.
Bộ tạo đề trở thành một phần của huấn luyện
Model card mô tả BigBang dùng khung dữ liệu tổng hợp đối kháng và tự tiến hóa. Generator agent đề xuất rồi giải các bài toán khoa học, kỹ thuật ngày càng khó. Critic agent kiểm tra độ đúng, độ khó, khả năng mở rộng và độ đa dạng.
Quy mô được báo cáo là khoảng 10.000 ví dụ hậu huấn luyện độ khó cao. Điểm chính không nằm ở số lượng, mà ở pipeline dữ liệu biết đổi miền bài toán, độ dài chuỗi suy luận, cách dùng công cụ và chiến lược lọc.
“AI advancing science, and science advancing AI.”
Câu này chỉ có trọng lượng khi nhiệm vụ có thể kiểm chứng. BigBang dựa vào các bài toán có thể kiểm tra bằng chạy mã, tính toán số, mô phỏng, phương pháp hình thức hoặc công cụ chuyên ngành.
Điểm số phải đi cùng giao thức
BigBang-V1 được báo cáo là đứng đầu nhóm mô hình 35B được chọn trên tám benchmark đại diện. Nó cũng vượt DeepSeek V4 Pro Preview trên FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev) và BioMysteryBench-HD.
Các mốc đáng chú ý gồm BrowseComp 76,5, SWE-Bench Pro 54,2, FrontierScience Research 46,2 và PaperBench(Code-Dev) 53,6. Nhưng so sánh cần đọc kèm điều kiện: BrowseComp, xbench, FrontierScience Research và HLE dùng general-agent runner trong repo; SWE-Bench Pro và SciCode-Verified dùng harness chính thức của từng benchmark.
Chuỗi kiểm chứng là phần quan trọng nhất
Repo GitHub nêu rõ chính sách chống nhiễm khi đánh giá: lọc trang Hugging Face khỏi kết quả tìm kiếm, chặn truy cập trực tiếp các domain đó và không đưa đáp án tham chiếu cho agent. Vòng lặp agent dùng search, visit, code_exec, với giới hạn 500 lần gọi công cụ cho mỗi trajectory.
Bước kế tiếp là tái kiểm tra độc lập, vận hành thật cửa sổ 262K và xem ý tưởng tạo dữ liệu này có chuyển được sang doanh nghiệp, dược phẩm hay robot hay không. Với hệ sinh thái mô hình Trung Quốc, thông điệp khá rõ: nhà máy nhiệm vụ có thể kiểm chứng đang trở thành năng lực nền.
Nguồn: QbitAI, model card Hugging Face, repo GitHub, báo cáo kỹ thuật Endless Frontier, CocoLoop; kiểm chứng quy mô tham số BigBang-V1, 3B tham số kích hoạt, ngữ cảnh 262K, khoảng 10.000 ví dụ hậu huấn luyện, điểm benchmark, harness đánh giá và chính sách chống nhiễm.