Un motor de inferencia de código abierto llamado Colibrì ha superado recientemente las 37.000 estrellas y los 4.000 forks en GitHub. Su propósito es directo: permitir que grandes modelos MoE de varios cientos de miles de millones, o incluso más de un billón de parámetros, se ejecuten en el ordenador de una persona común. Para Zhipu GLM-5.2, el proyecto indica una configuración mínima de 16 GB de RAM, con 24 GB recomendados, siendo la tarjeta gráfica opcional.
El proyecto fue creado el 1 de julio por Vincenzo Fornaro, está escrito íntegramente en C, no tiene dependencias externas en tiempo de ejecución y se distribuye bajo licencia Apache 2.0. La versión 1.12.0, publicada el 20 de septiembre, incorporó 81 pull requests; la versión 1.12.1 del 24 de septiembre sumó otras 96, de las cuales 80 procedían de colaboradores externos.
Los pesos viven en el disco: solo se lee la capa que se necesita
La característica de los modelos MoE es que el número total de parámetros es enorme, pero en cada token solo se usa una pequeña parte. GLM-5.2 tiene 744.000 millones de parámetros en total, pero cada pasada activa solo unos 40.000 millones. La idea de Colibrì es no cargar el modelo completo en memoria: los pesos completos, cuantizados en int4, se guardan en un SSD NVMe —unos 372 GB en el caso de GLM-5.2 y 419 GB en el de GLM-5.3.
El proyecto trata la VRAM, la RAM y el SSD como un almacenamiento unificado de tres niveles, algo que el autor describe como "compilación de los pesos en tiempo real". En la práctica, esto incluye: una caché LRU independiente por capa, mantener fijos en memoria a los expertos más usados, precargar con una capa de antelación los expertos que probablemente se necesitarán a continuación, fusionar en una sola lectura los expertos que requieren varios tokens, solapar la lectura de disco con el cálculo, y admitir la lectura en paralelo mediante striping en dos SSD.
El README es claro sobre el compromiso de velocidad: si el almacenamiento rápido no basta, el sistema simplemente se ralentiza, sin que baje la precisión del modelo. Sobre la velocidad en sí, el proyecto "no ofrece ninguna garantía".
Qué tan rápido va en la práctica
El proyecto ofrece varias mediciones:
- 6 RTX 5090, con todos los pesos residentes en memoria: de 5,8 a 6,8 tokens por segundo
- Escritorio solo con CPU y 128 GB de RAM, tras calentar la caché: alrededor de 1,8 por segundo
- Una sola RTX 5070 Ti: 1,07 por segundo
- Máquina de desarrollo del autor con 25 GB de RAM, en arranque en frío: de 0,05 a 0,1 por segundo
La versión 1.11.0, de mediados de septiembre, añadió soporte para DeepSeek V4.1 Flash, con 552.000 millones de parámetros y 510 GB de uso en disco, que en una máquina solo con CPU lee directamente los pesos oficiales sin conversión de formato. Según los registros del autor, la latencia de arranque en frío para una sola ronda bajó de 78,7 a 25,1 segundos, y en cinco rondas de conversación seguidas el rendimiento se estabilizó entre 1,14 y 1,58 tokens por segundo.
La principal novedad de la versión 1.12.0 se llama modo brio: quien hace la llamada entrega un conjunto limitado de opciones de respuesta, y el motor se limita a leer la probabilidad de cada opción, sin generar texto por muestreo; el número de tokens generados es cero y la respuesta no puede salirse de las opciones dadas. Para la mayoría de los usuarios locales, esto resulta mucho más práctico que esperar una respuesta palabra por palabra.
La lista de modelos compatibles es casi un catálogo de modelos abiertos chinos
Colibrì admite actualmente nueve familias de modelos: GLM-5.2/5.3 y la versión con visión GLM-5.3-Flash, DeepSeek V4 Flash y V4.1 Flash, Kimi K3, Qwen3.6 y Qwen3.8-Flash-Next, además de Inkling y OLMoE. Salvo estos dos últimos, todos proceden de empresas chinas: Zhipu, DeepSeek, Moonshot AI y Alibaba.
Para los desarrolladores en China, esto tiene una doble utilidad. Primero, los datos no salen de la máquina: en despachos de abogados, hospitales o fábricas donde no se pueden enviar documentos a la nube, una estación de trabajo con 128 GB de RAM y un SSD de 1 TB basta para ejecutar localmente un GLM de 744.000 millones de parámetros. Segundo, baja la barrera de entrada: para un modelo como Kimi K3, con 2,8 billones de parámetros y unos 1,6 TB de pesos en int4, que requiere al menos 32 GB de RAM, antes era prácticamente imposible que un particular lo hiciera funcionar en su propio equipo.
Las limitaciones son igual de evidentes. A una velocidad de uno o dos tokens por segundo, escribir una respuesta de mil palabras lleva más de diez minutos; la documentación del proyecto no ofrece una estimación de cuánto desgasta un SSD la lectura aleatoria intensiva y prolongada. El propio autor recuerda además que las ganancias de velocidad por decodificación especulativa son valores medidos que no necesariamente se reproducirán en otra máquina.
Fuentes: README del proyecto Colibrì, notas de las versiones Colibrì 1.11 a 1.12.1, QbitAI, CocoLoop; las cifras de velocidad corresponden a las configuraciones de prueba publicadas por el proyecto, y el número de estrellas procede de la página de GitHub.