H Company mã nguồn mở Holo4, mô hình 27 tỷ tham số điều khiển máy tính

Công ty AI Pháp H Company ngày 28/9 đã phát hành trên Hugging Face dòng mô hình Holo4, được thiết kế chuyên biệt cho các "tác nhân điều khiển máy tính": đọc ảnh chụp màn hình, nhấp chuột, gõ bàn phím, và cũng có thể gọi mã lệnh, MCP và API để hoàn thành nhiệm vụ. Thế hệ này có hai phiên bản chủ lực: mô hình dense Holo4-27B với 27 tỷ tham số, và mô hình hỗn hợp chuyên gia Holo4-35B-A3B với tổng cộng 35 tỷ tham số, mỗi lần chỉ kích hoạt khoảng 3 tỷ. Toàn bộ trọng số được công bố theo giấy phép Apache 2.0.

Ngoài ra còn có Holotron4 Nano, huấn luyện dựa trên Nemotron 3 Nano Omni của Nvidia, với cấu hình 30B-A3B.

H Company có trụ sở tại Paris, thành lập năm 2024, đội ngũ sáng lập có nhiều cựu nghiên cứu viên của DeepMind. Ngay trong năm thành lập, công ty đã gọi được vòng seed khoảng 220 triệu USD. Dòng Holo là sản phẩm chủ lực của công ty; theo blog chính thức, Holo4 được huấn luyện tiếp nối từ thế hệ trước.

Điểm số và định vị

H Company chủ yếu dựa vào OSWorld 2.0, một bộ benchmark cho mô hình thực hiện các thao tác nhiều bước trên hệ thống desktop thật. Bảng so sánh trên blog chính thức:

  • Holo4-27B: 61,7%
  • Claude Opus 5.5: 81,8%
  • Claude Opus 5: 70,2%
  • GPT-5.6 Sol: 66,2%

Từ những con số này, Holo4-27B đã tiến gần đến mức của mô hình đóng hàng đầu thế hệ trước, nhưng vẫn còn cách rõ ràng so với Opus 5.5 — mô hình mạnh nhất hiện nay. H Company cho biết trong các nhiệm vụ quy trình dài, Holo4 "chỉ thua vài mô hình đóng mạnh nhất", trong khi số tham số nhỏ hơn nhiều bậc và chi phí mỗi nhiệm vụ thấp hơn đáng kể.

Số liệu chi phí được nêu trong model card: Holo4-35B-A3B đạt 34,5% trên AutomationBench, với chi phí khoảng 0,02 USD mỗi nhiệm vụ. Chi phí mỗi nhiệm vụ của các mô hình khác trong blog chỉ được vẽ trên biểu đồ, không có số liệu cụ thể.

Các tình huống demo bao gồm dựng mô hình 3D, thiết kế game và tự động hóa quy trình nghiệp vụ doanh nghiệp. Tất cả các điểm số này đều chạy trong khung kiểm thử riêng của H Company; công ty cũng ghi rõ mô hình cần dùng kèm framework thực thi hai-agents của chính họ, và hiện chưa có kết quả tái lập độc lập từ bên thứ ba.

Điều này có ý nghĩa gì với các nhà phát triển Trung Quốc

Trước tiên là về nền tảng: model card của Holo4-35B-A3B ghi rõ mô hình gốc là Qwen3.6-35B-A3B của Alibaba, với ngữ cảnh tối đa 262.144 token. Các nhóm phát triển Trung Quốc đã rất quen với việc triển khai, lượng tử hóa và tối ưu suy luận cho kiến trúc này; khi chuyển sang trọng số của Holo4, chuỗi công cụ hầu như không cần thay đổi.

Về khả năng chạy cục bộ: Holo4-27B cung cấp các định dạng BF16, FP8, NVFP4 và Q4 GGUF; sau khi lượng tử hóa xuống 4-bit, có khả năng chạy được trên card đồ họa phổ thông 24GB VRAM — đây chỉ là ước tính thô, kết quả thực tế còn tùy độ phân giải ảnh chụp màn hình và độ dài ngữ cảnh. Mô hình 35B-A3B mỗi lần chỉ kích hoạt khoảng 3 tỷ tham số, nên có lợi thế hơn về tốc độ suy luận.

Các tác nhân điều khiển máy tính có một vấn đề khó tránh: chúng phải liên tục chụp màn hình và gửi cho mô hình. Với các mô hình đóng như Opus hay GPT, ảnh chụp màn hình phải được tải lên cloud nước ngoài — điều mà nhiều môi trường nội bộ trong tài chính, cơ quan nhà nước và sản xuất công nghiệp hoàn toàn không cho phép. Giấy phép Apache 2.0 cho phép sử dụng thương mại và chỉnh sửa, nên một mô hình mã nguồn mở có thể chạy tại chỗ và đạt điểm vượt 60% mang lại một lựa chọn thực sự khả dụng cho những trường hợp này.

H Company cũng cung cấp dịch vụ lưu trữ qua API H Models của riêng mình, mức giá hiện chưa được công bố.

Nguồn tham khảo: blog chính thức của H Company, model card trên Hugging Face, CocoLoop; điểm OSWorld 2.0 lấy theo blog của H Company, kết quả AutomationBench và chi phí mỗi nhiệm vụ lấy theo model card — toàn bộ do nhà sản xuất tự công bố.