A Apple anunciou dois novos chips, o M6 e o M5 Ultra, com o comunicado oficial citando diretamente "performance and AI compute". O M6 vai para o Mac mini, o M5 Ultra para o Mac Studio; ambos já estão disponíveis para pré-encomenda, com entregas a partir de 22 de setembro.
O M6 é o primeiro chip da Apple em 2nm e um dos primeiros produtos em produção em massa no processo de 2nm da TSMC. As especificações incluem CPU de 12 núcleos (2 super núcleos, 4 núcleos de performance, 6 núcleos de eficiência), GPU de 12 núcleos, dois Neural Engines de 16 núcleos, até 32GB de memória unificada e 170GB/s de largura de banda. Segundo a Apple, é o chip com o melhor desempenho single-thread do mundo, com desempenho multithread 1,2 vez maior que o M5; a capacidade de computação de IA da GPU cresce cerca de 30% em relação ao M5 e mais de 8 vezes em relação ao M1, enquanto o Neural Engine tem o dobro do desempenho da geração anterior.
O M5 Ultra segue o caminho do "mais é mais": usando uma nova geração da tecnologia UltraFusion para unir dois chips M5 Max (cada um já composto por dois dies), formando uma arquitetura de quatro chips — uma primeira vez na série M.
| M6 | M5 Ultra | |
|---|---|---|
| CPU | 12 núcleos | até 36 núcleos |
| GPU | 12 núcleos | até 80 núcleos |
| Neural Engine | 2x 16 núcleos | 32 núcleos |
| Memória unificada | até 32GB | até 512GB |
| Largura de banda | 170GB/s | 1,2TB/s |
A GPU do M5 Ultra ganhou Neural Accelerators nesta geração, elevando a capacidade de computação de IA em 4,5 vezes em relação ao M3 Ultra e mais de 6 vezes em relação ao M1 Ultra; a largura de banda de 1,2TB/s é 50% maior que a do M3 Ultra. Nas palavras da própria Apple: "M5 Ultra features a massive GPU, now with Neural Accelerators, and more unified memory bandwidth, pushing the boundaries of what a desktop can do".
O que cabe no limite de 512GB
O valor da memória unificada fica mais evidente em cenários de inferência local: CPU e GPU compartilham o mesmo bloco de memória, então os pesos do modelo não precisam ser movidos entre VRAM e RAM. Em soluções com placas de vídeo dedicadas, a quantidade de VRAM é o limite físico; no Mac Studio, esse limite agora é 512GB.
Fazendo uma conta simples: os modelos MoE de código aberto com 600 a 700 bilhões de parâmetros, após quantização em 4 bits, ficam com um tamanho de peso em torno de 350GB a 400GB; somando o cache KV e o overhead de execução, os 512GB são suficientes para acomodar o modelo inteiro em uma única máquina. Para atingir essa mesma capacidade de memória em um setup de data center, seria necessário interligar várias placas, com custo e consumo de energia em uma escala totalmente diferente.
A largura de banda ainda é o ponto fraco. 1,2TB/s é um número alto para um desktop, mas ainda fica atrás das soluções HBM usadas em data centers, o que limita visivelmente a velocidade de geração de tokens em inferências com contexto longo. O que se ganha em troca é outra coisa: uma máquina ligada na tomada, rodando modelos localmente, com os dados sem sair de casa.
O salto para 2nm
O M6 chega primeiro ao processo de 2nm, mantendo a Apple na dianteira desse ritmo. O ganho do novo processo aparece mais na eficiência energética do que na frequência máxima — dos 12 núcleos, 6 são núcleos de eficiência, somados a uma largura de banda de 170GB/s (apenas 10% acima do M5), o que mostra que o M6 foi projetado para manter o consumo de energia sob controle, com o ganho em capacidade de IA vindo principalmente da reformulação da GPU e do Neural Engine.
Olhando para o contexto do setor na mesma semana, as duas direções convergem. Nos data centers, a disputa é sobre quanta inferência é possível rodar por quilowatt; no desktop, é sobre até que ponto um modelo grande cabe em uma única máquina. O custo da inferência está sendo pressionado para baixo dos dois lados ao mesmo tempo, só que por caminhos diferentes.
Já o M6 do Mac mini, limitado a 32GB de memória, roda localmente apenas modelos de escala limitada — fica claro que o público-alvo desse chip não é esse.
Fontes: comunicado oficial da Apple Newsroom, MacRumors, CocoLoop, Phoronix, 9to5Mac; números de núcleos, capacidade e largura de banda de memória, além dos fatores de comparação, foram conferidos com o comunicado oficial; o tamanho dos modelos quantizados é uma estimativa baseada em parâmetros públicos.