Apple M6 dùng tiến trình 2nm, M5 Ultra mang 512GB RAM lên desktop

Apple vừa công bố hai chip M6 và M5 Ultra, với dòng chữ chính thức nêu thẳng "performance and AI compute". M6 được đưa vào Mac mini, M5 Ultra vào Mac Studio, hiện đã mở đặt hàng trước và sẽ giao hàng từ 22/9.

M6 là chip 2nm đầu tiên của Apple, đồng thời cũng là một trong những sản phẩm thương mại đầu tiên dùng tiến trình 2nm của TSMC. Cấu hình gồm CPU 12 nhân (2 nhân hiệu năng cao "super core", 4 nhân hiệu năng, 6 nhân tiết kiệm điện), GPU 12 nhân, hai Neural Engine 16 nhân, bộ nhớ hợp nhất tối đa 32GB với băng thông 170GB/s. Apple cho biết đây là chip có hiệu năng đơn luồng nhanh nhất thế giới, hiệu năng đa luồng nhanh hơn M5 1,2 lần, khả năng tính toán AI của GPU tăng khoảng 30% so với M5 và hơn 8 lần so với M1, còn Neural Engine mạnh gấp 2 lần thế hệ trước.

M5 Ultra đi theo hướng "chồng phần cứng": dùng công nghệ UltraFusion thế hệ mới để nối hai chip M5 Max (mỗi chip vốn đã là chip đôi) lại với nhau, tạo thành kiến trúc bốn chip — lần đầu tiên xuất hiện trên dòng M.

M6M5 Ultra
CPU12 nhânTối đa 36 nhân
GPU12 nhânTối đa 80 nhân
Neural EngineHai 16 nhân32 nhân
Bộ nhớ hợp nhấtTối đa 32GBTối đa 512GB
Băng thông bộ nhớ170GB/s1.2TB/s

GPU của M5 Ultra lần này được trang bị thêm Neural Accelerators, giúp khả năng tính toán AI tăng 4,5 lần so với M3 Ultra và hơn 6 lần so với M1 Ultra; băng thông 1.2TB/s cao hơn M3 Ultra 50%. Nguyên văn của Apple là "M5 Ultra features a massive GPU, now with Neural Accelerators, and more unified memory bandwidth, pushing the boundaries of what a desktop can do".

Ngưỡng 512GB chứa được gì

Ý nghĩa của bộ nhớ hợp nhất thể hiện rõ nhất khi suy luận (inference) tại chỗ: CPU và GPU dùng chung một khối bộ nhớ, trọng số mô hình không phải di chuyển qua lại giữa VRAM và RAM. Với các cấu hình dùng card đồ họa rời, dung lượng VRAM chính là giới hạn cứng; còn với Mac Studio, giới hạn đó giờ là 512GB.

Thử tính nhanh: nhóm mô hình MoE mã nguồn mở có 600-700 tỷ tham số, sau khi lượng tử hóa 4-bit, dung lượng trọng số rơi vào khoảng 350-400GB; cộng thêm KV cache và chi phí vận hành, 512GB vừa đủ để nhét trọn mô hình vào một máy duy nhất. Để đạt dung lượng bộ nhớ tương đương trên một cụm máy chủ trung tâm dữ liệu, phải ghép nhiều card qua kết nối liên chip, và chi phí lẫn công suất tiêu thụ nằm ở một cấp độ hoàn toàn khác.

Băng thông vẫn là điểm yếu. 1.2TB/s là con số rất cao đối với một máy để bàn, nhưng vẫn còn kém xa các giải pháp HBM trong trung tâm dữ liệu, nên tốc độ sinh token khi suy luận ngữ cảnh dài sẽ bị ảnh hưởng rõ rệt. Cái đánh đổi lấy được là một thứ khác: một cỗ máy cắm điện tường, chạy mô hình cục bộ, dữ liệu không rời khỏi nhà.

Bước tiến 2nm

M6 giành quyền ra mắt đầu tiên trên tiến trình 2nm, tiếp tục cho thấy Apple vẫn đi trước trong nhịp độ này. Lợi ích của tiến trình mới thể hiện ở hiệu suất năng lượng hơn là xung nhịp đỉnh — trong 12 nhân có tới 6 nhân tiết kiệm điện, cộng với băng thông 170GB/s (chỉ cao hơn M5 10%), cho thấy M6 được thiết kế để giữ mức tiêu thụ điện năng thấp, còn phần tăng trưởng năng lực AI chủ yếu đến từ việc tái thiết kế GPU và Neural Engine.

Đặt trong bối cảnh ngành công nghiệp cùng tuần, hai hướng đi này thực ra gặp nhau ở một điểm. Phía trung tâm dữ liệu đang chạy đua xem mỗi kilowatt chạy được bao nhiêu suy luận, phía máy để bàn đang chạy đua xem một máy nhét vừa mô hình lớn cỡ nào. Chi phí suy luận đang bị ép giảm từ cả hai đầu cùng lúc, chỉ khác cách ép.

Còn về M6 trên Mac mini với giới hạn bộ nhớ 32GB, quy mô mô hình có thể chạy cục bộ khá hạn chế, rõ ràng nhóm khách hàng mục tiêu của con chip này không nằm ở phân khúc đó.

Nguồn tham khảo: thông báo chính thức từ Apple Newsroom, MacRumors, CocoLoop, Phoronix, 9to5Mac; số nhân, dung lượng và băng thông bộ nhớ cùng các tỷ lệ so sánh được đối chiếu theo thông báo chính thức, dung lượng mô hình sau lượng tử hóa là ước tính dựa trên thông số công khai.