Apple intègre l'IA embarquée avec un modèle de 3B dans l'iPhone

La stratégie d'IA d'Apple est différente des autres — pas de course au modèle général le plus puissant, mais l'accent est mis sur le déploiement sur l'appareil et la protection de la vie privée.

Modèle embarqué : 3 milliards de paramètres

À la WWDC 2025, Apple a dévoilé les Apple Foundation Models (AFM), la version embarquée compte environ 3 milliards de paramètres, optimisée spécifiquement pour Apple Silicon.

Quelques technologies clés :

  • Partage du KV-cache : Le modèle est divisé en deux blocs (ratio de profondeur 5:3), le bloc arrière réutilise directement le KV-cache du bloc avant, réduisant l'utilisation mémoire de 37,5 %.
  • Entraînement conscient de la quantification 2 bits : Poids compressés à 2 bits, couche d'embedding à 4 bits, KV-cache à 8 bits.
  • Adaptateur de bas rang : Compense la perte de précision due à la quantification.

Résultat final : Un modèle de 3 milliards de paramètres est compressé pour fonctionner fluidement sur l'iPhone, tout en conservant un niveau de capacité suffisant.

Modèle serveur : PT-MoE

Les tâches complexes non traitables sur l'appareil sont envoyées au serveur, mais en utilisant le Private Cloud Compute d'Apple — exécuté sur des serveurs cloud avec des puces conçues par Apple, les données ne quittent pas l'enclave sécurisée d'Apple.

L'architecture serveur s'appelle Parallel-Track MoE, composée de plusieurs « pistes » Transformer plus petites traitant les tokens en parallèle, avec synchronisation uniquement aux entrées et sorties. Le coût de synchronisation est réduit de 87,5 %.

Priorité à la vie privée

L'ordre de priorité de la conception d'Apple est clair :

  1. Ce qui peut tourner sur l'appareil reste sur l'appareil
  2. Ce qui doit aller dans le cloud utilise Private Cloud Compute
  3. Prend en charge 15 langues, comprend les entrées texte et image

Cela contraste fortement avec l'approche « tout dans le cloud » d'OpenAI, Anthropic et Google. Apple parie que : les utilisateurs sont prêts à sacrifier certaines capacités pour la vie privée.

Les développeurs aussi y gagnent — Apple a ouvert le framework Foundation Models, permettant aux applications tierces d'appeler directement le modèle embarqué. Cependant, les capacités sont encore en retrait par rapport aux modèles cloud de niveau GPT-4, plus adaptés aux tâches légères de traitement et de compréhension de texte.

Source de référence : CocoLoop, Apple Machine Learning Research