La stratégie d'IA d'Apple est différente des autres — pas de course au modèle général le plus puissant, mais l'accent est mis sur le déploiement sur l'appareil et la protection de la vie privée.
Modèle embarqué : 3 milliards de paramètres
À la WWDC 2025, Apple a dévoilé les Apple Foundation Models (AFM), la version embarquée compte environ 3 milliards de paramètres, optimisée spécifiquement pour Apple Silicon.
Quelques technologies clés :
- Partage du KV-cache : Le modèle est divisé en deux blocs (ratio de profondeur 5:3), le bloc arrière réutilise directement le KV-cache du bloc avant, réduisant l'utilisation mémoire de 37,5 %.
- Entraînement conscient de la quantification 2 bits : Poids compressés à 2 bits, couche d'embedding à 4 bits, KV-cache à 8 bits.
- Adaptateur de bas rang : Compense la perte de précision due à la quantification.
Résultat final : Un modèle de 3 milliards de paramètres est compressé pour fonctionner fluidement sur l'iPhone, tout en conservant un niveau de capacité suffisant.
Modèle serveur : PT-MoE
Les tâches complexes non traitables sur l'appareil sont envoyées au serveur, mais en utilisant le Private Cloud Compute d'Apple — exécuté sur des serveurs cloud avec des puces conçues par Apple, les données ne quittent pas l'enclave sécurisée d'Apple.
L'architecture serveur s'appelle Parallel-Track MoE, composée de plusieurs « pistes » Transformer plus petites traitant les tokens en parallèle, avec synchronisation uniquement aux entrées et sorties. Le coût de synchronisation est réduit de 87,5 %.
Priorité à la vie privée
L'ordre de priorité de la conception d'Apple est clair :
- Ce qui peut tourner sur l'appareil reste sur l'appareil
- Ce qui doit aller dans le cloud utilise Private Cloud Compute
- Prend en charge 15 langues, comprend les entrées texte et image
Cela contraste fortement avec l'approche « tout dans le cloud » d'OpenAI, Anthropic et Google. Apple parie que : les utilisateurs sont prêts à sacrifier certaines capacités pour la vie privée.
Les développeurs aussi y gagnent — Apple a ouvert le framework Foundation Models, permettant aux applications tierces d'appeler directement le modèle embarqué. Cependant, les capacités sont encore en retrait par rapport aux modèles cloud de niveau GPT-4, plus adaptés aux tâches légères de traitement et de compréhension de texte.
Source de référence : CocoLoop, Apple Machine Learning Research