Muse Spark 1.3 đạt 75.4 điểm lập trình, vượt GPT-5.6 Sol

Mark Zuckerberg thông báo Muse Spark 1.3 bắt đầu được triển khai, đồng thời có mặt trên Muse Code và API mô hình của Meta. Ông mô tả đây là "bản nâng cấp lớn nhất từ trước đến nay của dòng sản phẩm này về lập trình và công việc tác tử", đồng thời cho rằng chi phí để đạt hiệu năng hàng đầu giờ đã rẻ đến mức khó tính toán.

Điểm số benchmark cho một nửa câu trả lời. Trên DeepSWE v1.1, Muse Spark 1.3 đạt 75.4 điểm, trong khi GPT-5.6 Sol đạt 73.0 và Claude Opus 5 đạt 74.0. Terminal-Bench 2.1 đạt 88.8 điểm, SWEAtlas CodeBase QnA đạt 59.4 điểm. Hai bài kiểm tra ngữ cảnh dài gần như đạt điểm tuyệt đối: MRCR ở khoảng 256K–512K đạt 98.5, còn 512K–1M đạt 98.1. So với phiên bản 1.2 trước đó, cùng một tác vụ lập trình, số lần gọi công cụ giảm khoảng 20%, lượng token tiêu thụ giảm khoảng 25%. Với những ai trả tiền theo token, con số này thực tế hơn nhiều so với điểm benchmark.

Mức giá rẻ, được chứng minh bằng dữ liệu

Câu "chi phí rẻ đến mức khó tính toán" cần được tách ra để hiểu rõ. Meta đưa ra hai mức giá cho Muse Spark 1.3: bản tiêu chuẩn 1,25 USD cho mỗi triệu token đầu vào, 4,25 USD cho mỗi triệu token đầu ra; bản đóng góp (contributor) chỉ 0,10 USD đầu vào và 0,20 USD đầu ra. Chênh lệch đầu vào là 12,5 lần, đầu ra là 21 lần.

Cái giá phải trả cho khoản chênh lệch đó nằm trong điều khoản sử dụng — nếu dùng bản đóng góp, dữ liệu đầu vào và đầu ra của bạn sẽ được Meta dùng để cải thiện sản phẩm. Cơ chế này đã áp dụng từ bản 1.2, và 1.3 chỉ tiếp tục duy trì. Với nhà phát triển cá nhân hay nhóm nhỏ, mức giá một hào cho đầu vào gần như miễn phí; còn với công ty cần bảo mật mã nguồn, mức giá này gần như không dùng được, họ chỉ có thể chọn mức tiêu chuẩn 1,25 USD — mức giá không hề rẻ so với các mô hình cùng thế hệ. Cái gọi là "rẻ đến mức khó tính toán" thực chất chỉ nói về mức giá đầu tiên.

Dẫn đầu về lập trình, tụt lại ở tác tử

Trên chỉ số thông minh của Artificial Analysis, Muse Spark 1.3 (chế độ xhigh) đạt 61 điểm, ngang bằng GPT-5.6 Sol (max) và Grok 4.6 (high), trong khi Claude Opus 5 (max) vẫn dẫn đầu với 63 điểm.

Khoảng cách thực sự nằm ở các hạng mục tác tử. Trên GDPVal-AA v2, Muse Spark 1.3 đạt 1754 điểm, còn Claude Opus 5 đạt 1824; OSWorld 2.0 là 66.9 so với 68.3; AutomationBench là 49.4 so với 50.3. Cả ba hạng mục đều thua, chênh lệch không lớn nhưng xu hướng nhất quán. Câu nói Zuckerberg nhắc đi nhắc lại trong cuộc họp báo cáo tài chính về "tác tử cá nhân làm việc 24/7 thay bạn" — nhìn vào những con số này, vẫn còn một chặng đường phía trước.

Hai điều vẫn còn bỏ ngỏ

Chế độ suy luận nâng cao phải chờ hoàn tất kiểm thử an toàn mới phát hành, phiên bản trọng số mở (open-weight) cũng nằm trong kế hoạch, nhưng chưa có mốc thời gian cụ thể. Bản 1.3 đã được gia cố khả năng chống đầu vào đối kháng và chèn lệnh (prompt injection) — điều dễ hiểu sau khi thế hệ mô hình trọng số mở trước đó bị chỉnh sửa theo đủ kiểu.

Thử tính nhẩm: nếu mức giá bản đóng góp được duy trì lâu dài, một tác tử lập trình tiêu thụ 5 triệu token đầu vào mỗi ngày sẽ tốn khoảng 15 USD một tháng. Con số này chẳng có gì cao siêu về công nghệ, nhưng lại quyết định có bao nhiêu người sẵn sàng đưa Muse Spark vào quy trình làm việc hàng ngày. Và chính đoạn mã họ viết ra sẽ trở thành nguyên liệu huấn luyện cho phiên bản tiếp theo.

Nguồn tham khảo: Trang giá API mô hình của Meta, chỉ số Artificial Analysis, CocoLoop, trang mô hình OpenRouter; các mức giá API và điểm benchmark DeepSWE, MRCR, Terminal-Bench đã được đối chiếu từng mục.