Tencent mở mã nguồn Hunyuan Hy4 preview, thắng sít sao GLM và Kimi trong đánh giá mù

Ngày 28/8, Tencent phát hành và mở mã nguồn mô hình Hunyuan Hy4 preview, tổng cộng 770 tỷ tham số, kích hoạt 49 tỷ tham số cho mỗi token, cửa sổ ngữ cảnh gốc đạt 1.048.576 token. Trọng số mô hình được đưa lên Hugging Face, ModelScope, GitCode... theo giấy phép Apache 2.0, đồng thời có mặt trên TokenHub của Tencent Cloud, OpenRouter, cũng như các sản phẩm riêng của Tencent là WorkBuddy/CodeBuddy, Yuanbao và ima. Tencent định vị đây là "một phiên bản sớm trong quá trình lặp của Hy4", với tuyên bố chính thức là "vững vàng ở nhóm dẫn đầu các mô hình mã nguồn mở".

Theo model card, Hy4 preview là một MoE có độ thưa cao điển hình: trong 78 lớp chỉ có 1 lớp FFN dày đặc, 77 lớp còn lại định tuyến qua các chuyên gia, mỗi lớp có 256 chuyên gia định tuyến cộng 1 chuyên gia dùng chung, mỗi token chọn 8 chuyên gia định tuyến. Chiều rộng lớp ẩn là 6144, kích thước từ vựng 120.832. Phần attention dùng cơ chế attention thưa có cổng (gated sparse attention) kèm IndexCache, nén truy vấn (query) xuống 2048 chiều, khóa-giá trị (key-value) xuống 512 chiều, kết hợp 4 luồng dư (residual) iHC. Về triển khai, mô hình hỗ trợ vLLM và SGLang, mặc định bật giải mã suy đoán MTP.

Đằng sau tỷ lệ kích hoạt 6,4% là một bài toán tính toán

49 tỷ chia cho 770 tỷ, tỷ lệ kích hoạt khoảng 6,4%. Con số này là chìa khóa để hiểu cách định giá cả mô hình — tổng số tham số quyết định chi phí bộ nhớ và tải mô hình, còn lượng kích hoạt quyết định khối lượng tính toán thực tế cho mỗi token. Tencent đã kéo giãn hai con số này ra hơn 15 lần, đổi lại là một bảng giá không quá đắt: đầu vào 6 nhân dân tệ/triệu token (khoảng 0,834 USD), đầu ra 18 nhân dân tệ (khoảng 2,501 USD), khi trúng cache chỉ còn 0,3 nhân dân tệ.

Mức giá này thuộc phân khúc trung bình trong nhóm mã nguồn mở của Trung Quốc. Cùng tuần phát hành, GLM-5.3-Flash có giá đầu vào thấp tới 0,075 USD/triệu token, chỉ bằng 1/11 so với Hy4 preview, nhưng đó là phiên bản nhẹ chỉ kích hoạt 18 tỷ tham số; còn Hy4 preview nhắm tới các tác vụ nặng như đọc mã nguồn xuyên nhiều tệp, phân tích xuyên nhiều tài liệu. Hai mô hình không cùng một hạng mục, so giá trực tiếp không có nhiều ý nghĩa.

Biến số chi phí thực sự nằm ở cửa sổ ngữ cảnh 1 triệu token. Nếu nạp đầy một triệu token cho một lượt đầu vào, tính theo giá niêm yết tốn khoảng 6 nhân dân tệ, sau khi trúng cache giảm xuống còn 0,3 nhân dân tệ — giá cache chỉ bằng 1/20 giá gốc, mức chiết khấu này gần như đang nói với các nhà phát triển: hãy dùng ngữ cảnh dài như một không gian làm việc thường trực, đừng truyền lại toàn bộ mỗi lần.

0,07 điểm chênh lệch nên hiểu thế nào

Kết quả đánh giá mù mà Tencent công bố: 163 chuyên gia nội bộ chấm 203 tác vụ kỹ thuật, Hy4 preview đạt trung bình 2,99 điểm (thang 4 điểm), GLM-5.3 đạt 2,92, Kimi K3 đạt 2,94.

Chênh lệch điểm số rất nhỏ, tỷ lệ thắng-thua lại chứa nhiều thông tin hơn. So với GLM-5.3, Hy4 preview thắng 46,8%, hòa 12,8%, thua 40,4%; so với Kimi K3, thắng 51,2%, hòa 7,9%, thua 40,9%. Tỷ lệ thua ở cả hai cặp đối đầu đều quanh mức 4/10, nghĩa là ở gần một nửa số tác vụ cụ thể, đối thủ làm tốt hơn. Ba mô hình bám sát nhau, không ai bứt lên rõ rệt.

Còn hai điều kiện giới hạn không thể bỏ qua: giám khảo là các chuyên gia nội bộ của Tencent, bộ tác vụ cũng do Tencent lựa chọn, kiểu đánh giá mù tự tổ chức này vốn có yếu tố sân nhà; với cỡ mẫu 203 tác vụ, chênh lệch 0,05 đến 0,07 điểm mang ý nghĩa thống kê khá hạn chế.

Các benchmark công khai cho phép so sánh chéo đáng tin hơn: SWE-bench Multilingual đạt 82,9, SWE-bench Pro đạt 65,7, Terminal-Bench 2.1 đạt 85,4, GPQA Diamond đạt 92,3, HLE có công cụ hỗ trợ đạt 55,4. SWE-bench Pro luôn là hạng mục mà các mô hình mất điểm nhiều nhất, con số 65,7 hiện thuộc nhóm dẫn đầu trong các mô hình mã nguồn mở.

Đặt cược vào các tác vụ dài hơi

Tencent nói thẳng hướng đi chính của mô hình này: kỹ thuật phần mềm dài hơi, phân tích văn phòng xuyên tệp, phát triển game và nghiên cứu khoa học. Mô hình cung cấp hai chế độ suy luận là high và no_think, chế độ trước dùng cho các tình huống cần chuỗi suy luận dài, chế độ sau để tiết kiệm token.

Một ví dụ được hãng đưa ra làm minh chứng là bài toán Blaschke–Lebesgue trong không gian ba chiều — mô hình đã đẩy cận dưới của thể tích từ 0,380799 lên 0,41104, còn cách giả thuyết tứ diện Meissner ở mức 0,41986 khoảng 2%. Sức thuyết phục của ví dụ này có giới hạn, đây là một minh chứng được chọn lọc kỹ, nhưng hướng đi khá rõ ràng: Tencent muốn đưa Hy4 preview vào quy trình nghiên cứu, chứ không chỉ dừng ở khung chat.

Đối với các nhà phát triển trong nước, tác động thực tế là có thêm một lựa chọn. GLM-5.3, Kimi K3, DeepSeek-V4-Pro đã lấp gần kín mảng ngữ cảnh dài mã nguồn mở, Hy4 preview chen chân vào nhờ giấy phép Apache 2.0 khá thoáng cùng dịch vụ suy luận có sẵn của Tencent Cloud. Điểm về giấy phép đặc biệt quan trọng — không ít mô hình mã nguồn mở trong nước kèm theo điều khoản hạn chế thương mại, còn Apache 2.0 nghĩa là doanh nghiệp có thể trực tiếp lấy về sửa đổi, triển khai, bán lại mà không cần đàm phán cấp phép riêng.

Suy cho cùng, bản preview vẫn chỉ là bản preview. Tencent chưa đưa ra thời gian biểu cho bản chính thức của Hy4, cũng chưa nói rõ khoảng cách giữa bản preview và bản chính thức sẽ lớn tới đâu.

Nguồn tham khảo: Blog kỹ thuật Tencent Hunyuan, model card trên Hugging Face, ITHome, CocoLoop, DataLearner; các thông số mô hình, cách tính đánh giá mù và giá API được đối chiếu theo model card chính thức và trang định giá, việc quy đổi giá chỉ là ước tính theo giá niêm yết.