Le 2 avril, Google DeepMind a publié Gemma 4.
Ce n'est pas le premier Gemma, mais il y a deux différences par rapport aux précédents : premièrement, le passage à la licence Apache 2.0 ; deuxièmement, la version 31B a atteint la troisième place dans le classement open source d'Arena AI.
Quatre modèles, comment choisir ?
| Modèle | Type | Paramètres activés | Contexte | Capacité spéciale |
|---|---|---|---|---|
| E2B | Dense (optimisé embarqué) | 2B | 128K | Entrée audio |
| E4B | Dense (optimisé embarqué) | 4B | 128K | Entrée audio |
| 26B A4B | MoE | ~4B | 256K | — |
| 31B | Dense (phare) | 31B | 256K | — |
Les E2B et E4B sont conçus pour les téléphones et les appareils de périphérie, avec prise en charge native de l'entrée audio (reconnaissance vocale) et multimodalité couvrant texte + image + audio. La conception MoE du 26B est similaire à DeepSeek : 26B de paramètres totaux, mais seulement environ 4B activés lors de l'inférence, offrant un bon rapport qualité-prix.
Le 31B est le modèle phare, classé troisième parmi les modèles open source dans le classement texte d'Arena AI, tandis que le 26B MoE est sixième. Les deux grandes versions surpassent des concurrents avec 20 fois moins de paramètres.
La signification d'Apache 2.0
Les séries précédentes de Gemma utilisaient une licence personnalisée, avec des restrictions d'utilisation nécessitant des négociations séparées avec Google pour les scénarios commerciaux. Avec le passage à Apache 2.0 :
- Utilisation commerciale sans demande d'autorisation
- Possibilité de modifier et redistribuer le code
- Aucune condition supplémentaire requise
Cela suit la même direction que la stratégie open source Apache 2.0 de Qwen 3. La guerre des licences des grands modèles open source a désormais Apache 2.0 comme réponse standard – quiconque utilise encore des licences restrictives se désavantage.
Quelle est la praticité des capacités embarquées ?
Les E2B et E4B sont conçus pour les téléphones et le Raspberry Pi. Selon Google, l'E4B est 4 fois plus rapide et économise 60 % d'énergie par rapport à la version précédente. L'E2B offre des performances 3 fois plus rapides et une latence réduite.
Compte tenu du stockage et de la puissance de calcul des téléphones phares actuels, l'E4B devrait fonctionner sans problème. Google a clairement indiqué que Gemma 4 servira de modèle de base pour Gemini Nano 4 sur les appareils Android plus tard cette année. En d'autres termes, ce n'est pas seulement pour les développeurs, cela arrivera dans les téléphones des utilisateurs ordinaires.
Comparaison avec Meta Llama 4
Au même moment, Meta pousse également Llama 4. Les deux entreprises rivalisent dans l'open source, utilisent MoE ou des architectures embarquées efficaces, prennent en charge la multimodalité et adoptent la licence Apache 2.0.
La différenciation de Gemma 4 réside dans les capacités embarquées : la prise en charge de l'entrée audio de la série E et la conception à ultra-faible consommation sont des domaines sur lesquels Llama 4 ne s'est pas encore concentré. Si vous êtes un développeur travaillant dans des scénarios mobiles ou IoT, la série E de Gemma 4 mérite une sérieuse considération.
La prise en charge de plus de 140 langues est également significative pour les scénarios non anglophones. Les performances spécifiques en chinois, attendons que la communauté effectue les tests.
Sources de référence : CocoLoop, Gemma 4: Byte for byte, the most capable open models (Google DeepMind Blog) ; Google Releases Gemma 4 in Four Model Sizes Under Apache 2.0 License (gHacks Tech News) ; Announcing Gemma 4 in the AICore Developer Preview (Android Developers Blog)