Apple pasa a 2nm con el M6, el M5 Ultra lleva 512GB de RAM al escritorio

Apple ha presentado dos nuevos chips, el M6 y el M5 Ultra, cuyo comunicado oficial menciona directamente "performance and AI compute". El M6 llega al Mac mini y el M5 Ultra al Mac Studio; ambos ya están disponibles para reserva, con entregas a partir del 22 de septiembre.

El M6 es el primer chip de Apple en 2nm y uno de los primeros productos fabricados en masa con el proceso de 2nm de TSMC. Sus especificaciones son CPU de 12 núcleos (2 súper núcleos, 4 núcleos de rendimiento, 6 núcleos de eficiencia), GPU de 12 núcleos, doble Neural Engine de 16 núcleos, hasta 32GB de memoria unificada y 170GB/s de ancho de banda. Según Apple, ofrece el rendimiento de un solo hilo más rápido del mundo, un rendimiento multihilo 1,2 veces superior al M5, una capacidad de cómputo de IA en la GPU un 30% mayor que la del M5 y más de 8 veces la del M1, y un Neural Engine con el doble de rendimiento respecto a la generación anterior.

El M5 Ultra sigue la vía de "más es más": mediante una nueva generación de UltraFusion conecta dos chips M5 Max, cada uno ya compuesto por dos dados, formando una arquitectura de cuatro chips, algo inédito en la serie M.

M6M5 Ultra
CPU12 núcleoshasta 36 núcleos
GPU12 núcleoshasta 80 núcleos
Neural Engine2x 16 núcleos32 núcleos
Memoria unificadahasta 32GBhasta 512GB
Ancho de banda170GB/s1,2TB/s

La GPU del M5 Ultra incorpora esta vez Neural Accelerators, lo que eleva la capacidad de cómputo de IA 4,5 veces respecto al M3 Ultra y más de 6 veces respecto al M1 Ultra; el ancho de banda de 1,2TB/s es un 50% superior al del M3 Ultra. En palabras textuales de Apple: "M5 Ultra features a massive GPU, now with Neural Accelerators, and more unified memory bandwidth, pushing the boundaries of what a desktop can do".

Qué cabe en el límite de 512GB

El valor de la memoria unificada se aprecia mejor en escenarios de inferencia local: la CPU y la GPU comparten un mismo bloque de memoria, por lo que los pesos del modelo no tienen que moverse entre VRAM y RAM. En soluciones con tarjeta gráfica dedicada, la cantidad de VRAM es el límite físico; en el Mac Studio, ese límite es ahora de 512GB.

Haciendo un cálculo aproximado: los modelos MoE de código abierto de 600 a 700 mil millones de parámetros, tras cuantizarse a 4 bits, tienen un peso de entre 350GB y 400GB; sumando la caché KV y la sobrecarga de ejecución, los 512GB bastan justo para alojar el modelo completo en una sola máquina. Igualar esa capacidad de memoria en un centro de datos con especificaciones equivalentes requeriría interconectar varias tarjetas, con un coste y un consumo eléctrico de una escala completamente distinta.

El ancho de banda sigue siendo el punto débil. 1,2TB/s es una cifra alta para un equipo de escritorio, pero todavía queda por detrás de las soluciones HBM de los centros de datos, lo que limita de forma notable la velocidad de generación de tokens en inferencias con contexto largo. Lo que se gana a cambio es otra cosa: una máquina enchufada a la pared, que ejecuta modelos en local sin que los datos salgan de casa.

El salto a los 2 nanómetros

El M6 se estrena en el proceso de 2nm, con Apple manteniéndose a la cabeza en este ritmo. El beneficio del nuevo proceso se nota más en la eficiencia energética que en la frecuencia máxima: de los 12 núcleos, 6 son de eficiencia, junto con un ancho de banda de 170GB/s (apenas un 10% más que el M5), lo que indica que el M6 está diseñado para mantener bajo el consumo, y que el aumento de potencia de IA proviene sobre todo del rediseño de la GPU y el Neural Engine.

Visto en el contexto de la industria de esta misma semana, ambas direcciones convergen. En los centros de datos se compite por cuánta inferencia se puede ejecutar por kilovatio; en el escritorio, por cuán grande puede ser un modelo que quepa en una sola máquina. El coste de la inferencia se está reduciendo desde ambos extremos a la vez, solo que por vías distintas.

En cuanto al M6 del Mac mini, con su límite de 32GB de memoria, el tamaño de los modelos que puede ejecutar en local es limitado, por lo que el público objetivo de este chip claramente no está en ese segmento.

Fuentes: comunicado oficial de Apple Newsroom, MacRumors, CocoLoop, Phoronix, 9to5Mac; los números de núcleos, capacidad y ancho de banda de memoria, así como los factores de comparación, se contrastaron con el comunicado oficial; el tamaño de los modelos cuantizados es una estimación basada en parámetros públicos.