Le M6 d'Apple passe au 2 nm, le M5 Ultra apporte 512 Go de RAM sur bureau

Apple a présenté deux nouvelles puces, le M6 et le M5 Ultra, dont le communiqué officiel mentionne explicitement "performance and AI compute". Le M6 équipe le Mac mini, le M5 Ultra le Mac Studio ; les précommandes sont ouvertes, avec des livraisons à partir du 22 septembre.

Le M6 est la première puce d'Apple gravée en 2 nm, et l'un des premiers produits fabriqués en série sur le procédé 2 nm de TSMC. Ses caractéristiques : CPU 12 cœurs (2 super-cœurs, 4 cœurs performance, 6 cœurs efficacité), GPU 12 cœurs, double Neural Engine 16 cœurs, jusqu'à 32 Go de mémoire unifiée et 170 Go/s de bande passante. Selon Apple, elle offre les meilleures performances mono-cœur au monde, des performances multi-cœurs 1,2 fois supérieures au M5, une puissance de calcul IA du GPU en hausse d'environ 30 % par rapport au M5 et de plus de 8 fois par rapport au M1, avec un Neural Engine deux fois plus performant que la génération précédente.

Le M5 Ultra mise sur la surenchère matérielle : grâce à une nouvelle génération d'UltraFusion, deux puces M5 Max, elles-mêmes déjà composées de deux dies chacune, sont assemblées pour former une architecture à quatre puces — une première pour la série M.

M6M5 Ultra
CPU12 cœursjusqu'à 36 cœurs
GPU12 cœursjusqu'à 80 cœurs
Neural Engine2x 16 cœurs32 cœurs
Mémoire unifiéejusqu'à 32 Gojusqu'à 512 Go
Bande passante mémoire170 Go/s1,2 To/s

Le GPU du M5 Ultra embarque cette fois des Neural Accelerators, ce qui porte sa puissance de calcul IA à 4,5 fois celle du M3 Ultra et plus de 6 fois celle du M1 Ultra ; la bande passante de 1,2 To/s dépasse de 50 % celle du M3 Ultra. Apple l'exprime ainsi, mot pour mot : "M5 Ultra features a massive GPU, now with Neural Accelerators, and more unified memory bandwidth, pushing the boundaries of what a desktop can do".

Ce que permet le seuil des 512 Go

L'intérêt de la mémoire unifiée se voit surtout en inférence locale : le CPU et le GPU partagent le même bloc de mémoire, si bien que les poids du modèle n'ont pas à transiter entre VRAM et RAM. Avec une carte graphique dédiée, la quantité de VRAM constitue une limite matérielle stricte ; sur le Mac Studio, cette limite atteint désormais 512 Go.

Un calcul rapide : les modèles MoE open source de 600 à 700 milliards de paramètres pèsent, une fois quantifiés en 4 bits, environ 350 à 400 Go ; en ajoutant le cache KV et la surcharge d'exécution, 512 Go suffisent tout juste pour loger le modèle entier sur une seule machine. Atteindre une telle capacité mémoire dans un data center de spécifications équivalentes nécessiterait d'interconnecter plusieurs cartes, avec un coût et une consommation électrique d'un tout autre ordre de grandeur.

La bande passante reste le point faible. 1,2 To/s est un chiffre élevé pour un ordinateur de bureau, mais reste en retrait par rapport aux solutions HBM des data centers, ce qui limite nettement la vitesse de génération de tokens lors d'inférences à long contexte. Ce que l'on gagne en échange, c'est autre chose : une machine simplement branchée sur secteur, qui fait tourner des modèles en local, sans que les données ne sortent de la maison.

Le pas vers les 2 nanomètres

Le M6 inaugure le procédé 2 nm, Apple restant ainsi en tête sur ce rythme. Le bénéfice du nouveau procédé se traduit surtout par l'efficacité énergétique plutôt que par la fréquence maximale — sur les 12 cœurs, 6 sont des cœurs efficacité, avec une bande passante de 170 Go/s (seulement 10 % de plus que le M5), ce qui montre que le M6 est conçu pour contenir la consommation, l'essentiel du gain de puissance IA venant de la refonte du GPU et du Neural Engine.

Replacées dans le contexte industriel de la même semaine, ces deux orientations convergent. Côté data centers, la course porte sur la quantité d'inférence exécutable par kilowatt ; côté bureau, sur la taille de modèle qu'une seule machine peut contenir. Le coût de l'inférence est en train d'être tiré vers le bas des deux côtés à la fois, simplement par des moyens différents.

Quant au M6 du Mac mini, plafonné à 32 Go de mémoire, l'ampleur des modèles qu'il peut faire tourner en local reste limitée — sa cible n'est manifestement pas ce segment.

Sources : communiqué officiel d'Apple Newsroom, MacRumors, CocoLoop, Phoronix, 9to5Mac ; le nombre de cœurs, la capacité et la bande passante mémoire ainsi que les facteurs de comparaison ont été vérifiés à partir du communiqué officiel, la taille des modèles quantifiés est une estimation basée sur des paramètres publics.