Apple introduce IA en el dispositivo con modelo de 3B en el iPhone

La estrategia de IA de Apple es diferente a la de otras empresas — no compite por el modelo general más potente, sino que se centra en la implementación en el dispositivo y la protección de la privacidad.

Modelo en el dispositivo: 3 mil millones de parámetros

En la WWDC 2025, Apple presentó los Apple Foundation Models (AFM), la versión en el dispositivo tiene aproximadamente 3 mil millones de parámetros, optimizada específicamente para Apple Silicon.

Algunas tecnologías clave:

  • Compartición de KV-cache: El modelo se divide en dos bloques (proporción de profundidad 5:3), el bloque posterior reutiliza directamente el KV-cache del anterior, reduciendo el uso de memoria en un 37,5%.
  • Entrenamiento consciente de cuantización de 2 bits: Pesos comprimidos a 2 bits, capa de embedding a 4 bits, KV-cache a 8 bits.
  • Adaptador de bajo rango: Compensa la pérdida de precisión causada por la cuantización.

Resultado final: Un modelo de 3 mil millones de parámetros se comprime para funcionar sin problemas en el iPhone, manteniendo un nivel de capacidad suficiente.

Modelo de servidor: PT-MoE

Las tareas complejas que no se pueden procesar en el dispositivo se envían al servidor, pero utilizando el Private Cloud Compute de Apple — ejecutado en servidores en la nube con chips propios de Apple, los datos no salen del enclave seguro de Apple.

La arquitectura del servidor se llama Parallel-Track MoE, compuesta por múltiples "pistas" más pequeñas de Transformer que procesan tokens en paralelo, sincronizándose solo en los bordes de entrada y salida. La sobrecarga de sincronización se reduce en un 87,5%.

Prioridad de privacidad

El orden de prioridad del diseño de Apple es claro:

  1. Lo que pueda ejecutarse en el dispositivo, se queda en el dispositivo
  2. Lo que deba ir a la nube usa Private Cloud Compute
  3. Admite 15 idiomas, comprende entrada de texto e imagen

Esto contrasta fuertemente con el enfoque de "todo a la nube" de OpenAI, Anthropic y Google. Apple apuesta a que: los usuarios están dispuestos a sacrificar algo de capacidad por la privacidad.

Los desarrolladores también se benefician — Apple abrió el framework Foundation Models, permitiendo que aplicaciones de terceros llamen directamente al modelo en el dispositivo. Sin embargo, las capacidades aún están por detrás de los modelos en la nube de nivel GPT-4, siendo más adecuados para tareas ligeras de procesamiento y comprensión de texto.

Fuente de referencia: CocoLoop, Apple Machine Learning Research