Ngày 21 tháng 9, SpaceXAI ra mắt Grok 4.7, được hãng mô tả là "mô hình mạnh nhất của mình cho lập trình và công việc tri thức". Giá API và tốc độ giữ nguyên so với Grok 4.6: 2 đô la Mỹ cho mỗi triệu token đầu vào, 6 đô la Mỹ cho mỗi triệu token đầu ra, cùng với một phiên bản nhanh có giá gấp đôi và tốc độ đầu ra gấp đôi. Mô hình đã có mặt trên Cursor, Grok Build, bảng điều khiển API và các nền tảng bên thứ ba.
"our most capable model for coding and knowledge work."
Đây là cách SpaceXAI định vị chính thức cho Grok 4.7: mô hình dành cho lập trình và công việc tri thức.
Theo hãng, mô hình mới dùng nền tảng lớn hơn Grok 4.6, thời gian huấn luyện tăng cường học tăng dài hơn, tập trung rèn luyện cho các tác vụ dài kéo dài nhiều giờ, giỏi hơn trong việc tự kiểm chứng và xử lý ngữ cảnh dài, đồng thời được tích hợp gốc với Grok Bot.
Điểm số chính thức và đánh giá bên thứ ba
Một số kết quả SpaceXAI tự công bố: DeepSWE v1.1 đạt 71,0%, CursorBench 4.0 đạt 46,3%, Terminal-Bench 4.0 đạt 37,6%, EEBench (lĩnh vực kỹ thuật điện) đạt 64,0%. Về an toàn, hãng cho biết khả năng từ chối trả lời và chống bẻ khóa dẫn đầu ngành, tỷ lệ để lọt cảnh báo rủi ro trên HackerBench v0.3 là 3,3%, còn năng lực red-team chỉ mở theo hình thức mời cho một số đối tác an ninh mạng.
Kết quả từ tổ chức đánh giá độc lập Artificial Analysis: chỉ số thông minh tổng hợp đạt 46 điểm, cao hơn Grok 4.6 2 điểm; chỉ số tác nhân lập trình khi kết hợp với Grok Build đạt 56 điểm, cao hơn 9 điểm so với 4.6. Ở các hạng mục cụ thể, DeepSWE v1.1 tăng từ 65% lên 73%, Terminal-Bench 4.0 tăng từ 18% lên 33%, SWE-Atlas-QnA tăng từ 58% lên 63%. Theo đánh giá này, Grok 4.7 kết hợp Grok Build xếp thứ tư về chỉ số tác nhân lập trình, sau Claude Fable 5.1, GPT-6 Astra và Claude Opus 5. Ở bài kiểm tra công việc tri thức dài hạn AA-Briefcase, mô hình đạt 1.657 điểm Elo, cao hơn 111 điểm so với 4.6.
Trang phát hành chính thức không đưa ra bảng xếp hạng so với đối thủ, và SpaceXAI cũng không phản hồi về thứ hạng trong các đánh giá bên thứ ba.
Tính thử một bài toán chi phí
Bảng giá không đổi, nhưng lượng token sử dụng mà Artificial Analysis ghi nhận đã thay đổi: ở mức xhigh, Grok 4.7 xuất trung bình khoảng 81.000 token đầu ra cho mỗi tác vụ, trong khi Grok 4.6 ở cùng mức chỉ khoảng 38.000, tăng 125%. Tốc độ đầu ra khoảng 188 token mỗi giây, trung bình mỗi tác vụ chạy 7,1 phút.
Tính nhẩm, chỉ riêng phần đầu ra, một tác vụ trên Grok 4.6 tốn khoảng 0,23 đô la Mỹ, còn trên Grok 4.7 khoảng 0,49 đô la Mỹ. Giá niêm yết không đổi nhưng chi phí thực tế theo tác vụ đã tăng hơn gấp đôi, phần điểm số tăng thêm phần lớn đến từ việc mô hình "suy nghĩ lâu hơn".
Đặt vào bảng giá của tuần này, phép tính càng rõ hơn. Một ngày sau khi Grok 4.7 ra mắt, Claude Opus 5.5 của Anthropic và GPT-6 Sol của OpenAI lần lượt lên sóng: Opus 5.5 có giá 4 đô la Mỹ cho mỗi triệu token đầu vào và 20 đô la Mỹ cho đầu ra, còn GPT-6 Sol giảm xuống còn 2 đô la Mỹ và 10 đô la Mỹ. Xét theo giá niêm yết trên mỗi triệu token, giá đầu ra của Grok 4.7 vẫn thấp nhất; còn xét theo chi phí thực tế mỗi tác vụ, khoảng cách này sẽ thu hẹp đến đâu còn tùy vào lượng token mà hai mô hình kia sử dụng, dữ liệu bên thứ ba cho phần này vẫn chưa đầy đủ.
Chưa đầy hai ngày sau khi Grok 4.7 đạt 46 điểm, hai thế hệ mô hình mới Opus 5.5 và GPT-6 đã vào hàng chờ đánh giá của Artificial Analysis, nửa trên của bảng xếp hạng nhiều khả năng sẽ còn thay đổi.
Nguồn tham khảo: Trang phát hành chính thức của SpaceXAI, CocoLoop, báo cáo đánh giá của Artificial Analysis; giá API và điểm số chính thức được đối chiếu theo trang phát hành của SpaceXAI, chỉ số thông minh, chỉ số tác nhân lập trình và lượng token sử dụng được đối chiếu theo số liệu của Artificial Analysis, chi phí đầu ra mỗi tác vụ là ước tính thô theo giá niêm yết.