Un moteur d'inférence open source baptisé Colibrì a récemment franchi la barre des 37 000 étoiles et des 4 000 forks sur GitHub. Son objectif est simple : permettre à de grands modèles MoE de plusieurs centaines de milliards, voire plus d'un billion de paramètres, de tourner sur l'ordinateur d'un particulier. Pour Zhipu GLM-5.2, le projet indique une configuration minimale de 16 Go de RAM, 24 Go étant recommandés, une carte graphique restant facultative.
Le projet a été créé le 1er juillet par Vincenzo Fornaro. Il est écrit entièrement en C, ne dépend d'aucune bibliothèque externe à l'exécution, et distribué sous licence Apache 2.0. La version 1.12.0, publiée le 20 septembre, a fusionné 81 pull requests ; la version 1.12.1 du 24 septembre en a fusionné 96 de plus, dont 80 provenant de contributeurs externes.
Les poids restent sur le disque, on ne charge que ce qui est utilisé
Les modèles MoE se caractérisent par un nombre total de paramètres élevé, mais dont seule une petite partie est réellement utilisée à chaque token. GLM-5.2 compte 744 milliards de paramètres au total, mais seuls environ 40 milliards sont activés à chaque passage. L'idée de Colibrì est de ne pas charger le modèle entier en mémoire : les poids complets, quantifiés en int4, sont stockés sur un SSD NVMe — environ 372 Go pour GLM-5.2, 419 Go pour GLM-5.3.
Le projet traite la VRAM, la RAM et le SSD comme un espace de stockage unifié à trois niveaux, que l'auteur appelle une « compilation à la volée des poids ». Concrètement : un cache LRU distinct par couche, le maintien permanent en mémoire des experts les plus sollicités, le préchargement anticipé des experts probablement nécessaires à la couche suivante, la fusion en une seule lecture des experts requis par plusieurs tokens, le chevauchement de la lecture disque et du calcul, ainsi que la prise en charge de deux SSD en lecture parallèle par bandes.
Le README est clair sur le compromis en matière de vitesse : si le stockage rapide ne suffit pas, le système ralentit simplement, sans perte de précision du modèle. Sur la vitesse elle-même, le projet ne donne « aucune garantie ».
Quelle vitesse réelle
Le projet fournit plusieurs mesures :
- 6 RTX 5090, tous les poids maintenus en mémoire : 5,8 à 6,8 tokens par seconde
- PC de bureau 100 % CPU avec 128 Go de RAM, après préchauffage du cache : environ 1,8 par seconde
- Une seule RTX 5070 Ti : 1,07 par seconde
- Machine de développement de l'auteur avec 25 Go de RAM, démarrage à froid : 0,05 à 0,1 par seconde
La version 1.11.0, publiée mi-septembre, a ajouté la prise en charge de DeepSeek V4.1 Flash, 552 milliards de paramètres pour 510 Go sur disque, lu directement à partir des poids officiels sur une machine 100 % CPU, sans conversion de format. Selon les relevés de l'auteur, la latence d'un premier échange à froid est passée de 78,7 à 25,1 secondes, et sur cinq tours de conversation consécutifs, le débit s'est stabilisé entre 1,14 et 1,58 token par seconde.
La principale nouveauté de la version 1.12.0 s'appelle le mode brio : l'appelant fournit un jeu limité de réponses possibles, et le moteur se contente de lire la probabilité de chaque option, sans génération par échantillonnage — le nombre de tokens produits est nul, et la réponse ne peut pas sortir des options proposées. Pour la plupart des utilisateurs en local, c'est bien plus pratique que d'attendre une réponse mot par mot.
La liste des modèles pris en charge ressemble presque à un catalogue des modèles ouverts chinois
Colibrì prend actuellement en charge neuf familles de modèles : GLM-5.2/5.3 ainsi que GLM-5.3-Flash, compatible avec la vision, DeepSeek V4 Flash et V4.1 Flash, Kimi K3, Qwen3.6 et Qwen3.8-Flash-Next, ainsi qu'Inkling et OLMoE. À l'exception de ces deux derniers, tous proviennent d'entreprises chinoises : Zhipu, DeepSeek, Moonshot AI et Alibaba.
Pour les développeurs en Chine, cela présente un double intérêt. D'abord, les données ne quittent pas la machine : pour les cabinets d'avocats, les hôpitaux ou les usines qui ne peuvent pas envoyer leurs documents vers le cloud, une station de travail avec 128 Go de RAM et un SSD d'1 To suffit pour faire tourner localement un GLM à 744 milliards de paramètres. Ensuite, la barrière à l'entrée s'abaisse : pour un modèle comme Kimi K3, avec 2 800 milliards de paramètres et des poids int4 d'environ 1,6 To, nécessitant au moins 32 Go de RAM, il était auparavant quasiment impossible pour un particulier de le faire tourner sur sa propre machine.
Les limites sont tout aussi nettes. À une vitesse d'un à deux tokens par seconde, une réponse de mille mots prend une dizaine de minutes ; la documentation du projet ne chiffre pas l'usure d'un SSD soumise à une lecture aléatoire intensive et prolongée. L'auteur lui-même rappelle que les gains de vitesse obtenus grâce au décodage spéculatif sont des valeurs mesurées, qui ne se reproduiront pas nécessairement sur une autre machine.
Sources : README du projet Colibrì, notes de version Colibrì 1.11 à 1.12.1, QbitAI, CocoLoop ; les chiffres de vitesse correspondent aux configurations de test publiées par le projet, le nombre d'étoiles provient de la page GitHub.