A estratégia de IA da Apple é diferente das outras — não disputa o modelo geral mais forte, mas foca em implantação no dispositivo e proteção de privacidade.
Modelo no dispositivo: 3B parâmetros
Na WWDC 2025, a Apple anunciou os Apple Foundation Models (AFM), a versão no dispositivo tem aproximadamente 3 bilhões de parâmetros, otimizada especificamente para Apple Silicon.
Algumas tecnologias-chave:
- Compartilhamento de KV-cache: O modelo é dividido em dois blocos (proporção de profundidade 5:3), o bloco posterior reutiliza diretamente o KV-cache do anterior, reduzindo o uso de memória em 37,5%.
- Treinamento consciente de quantização de 2 bits: Pesos comprimidos para 2 bits, camada de embedding para 4 bits, KV-cache para 8 bits.
- Adaptador de baixo posto: Compensa a perda de precisão causada pela quantização.
Resultado final: Um modelo de 3 bilhões de parâmetros é comprimido para rodar suavemente no iPhone, mantendo um nível de capacidade suficiente.
Modelo de servidor: PT-MoE
Tarefas complexas que não podem ser processadas no dispositivo são enviadas ao servidor, mas usando o Private Cloud Compute da Apple — executado em servidores em nuvem com chips proprietários da Apple, os dados não saem do enclave seguro da Apple.
A arquitetura do servidor é chamada Parallel-Track MoE, composta por várias "trilhas" menores de Transformer processando tokens em paralelo, sincronizando apenas nas bordas de entrada e saída. A sobrecarga de sincronização é reduzida em 87,5%.
Prioridade de privacidade
A ordem de prioridade do design da Apple é clara:
- O que pode rodar no dispositivo, fica no dispositivo
- O que precisa ir para a nuvem usa Private Cloud Compute
- Suporta 15 idiomas, entende entrada de texto e imagem
Isso contrasta fortemente com a abordagem "tudo na nuvem" da OpenAI, Anthropic e Google. A Apple aposta que: os usuários estão dispostos a sacrificar algum limite de capacidade pela privacidade.
Desenvolvedores também se beneficiam — a Apple abriu o framework Foundation Models, permitindo que aplicativos de terceiros chamem diretamente o modelo no dispositivo. No entanto, as capacidades ainda estão aquém dos modelos em nuvem de nível GPT-4, sendo mais adequados para tarefas leves de processamento e compreensão de texto.
Fonte de referência: CocoLoop, Apple Machine Learning Research