Colibrì lässt GLM-5.2 mit 16 GB RAM laufen – dank SSD

Die Open-Source-Inferenz-Engine Colibrì ist auf GitHub zuletzt auf über 37.000 Sterne und mehr als 4.000 Forks gestiegen. Ihr Zweck ist unkompliziert: Sie soll MoE-Modelle mit mehreren hundert Milliarden bis über einer Billion Parametern auf gewöhnlichen PCs lauffähig machen. Am Beispiel von Zhipus GLM-5.2 nennt das Projekt als Mindestanforderung 16 GB Arbeitsspeicher, empfohlen werden 24 GB – eine Grafikkarte ist optional.

Das Projekt wurde am 1. Juli von Vincenzo Fornaro gestartet, ist vollständig in C geschrieben, kommt zur Laufzeit ohne externe Abhängigkeiten aus und steht unter der Apache-2.0-Lizenz. Version 1.12.0 vom 20. September führte 81 Pull Requests zusammen, Version 1.12.1 vom 24. September weitere 96, davon 80 von externen Mitwirkenden.

Gewichte liegen auf der Festplatte – geladen wird nur, was gebraucht wird

MoE-Modelle zeichnen sich dadurch aus, dass die Gesamtzahl der Parameter groß ist, pro Token aber nur ein kleiner Teil davon tatsächlich genutzt wird. GLM-5.2 hat insgesamt 744 Milliarden Parameter, aktiviert werden pro Durchlauf aber nur rund 40 Milliarden. Colibrìs Ansatz besteht darin, nicht das gesamte Modell in den Arbeitsspeicher zu laden: Die vollständigen, auf int4 quantisierten Gewichte liegen auf einer NVMe-SSD – bei GLM-5.2 rund 372 GB, bei GLM-5.3 rund 419 GB.

Das Projekt behandelt VRAM, RAM und SSD als einen einheitlichen dreistufigen Speicher, was der Autor als „Just-in-Time-Kompilierung der Gewichte" bezeichnet. Konkret bedeutet das: ein separater LRU-Cache pro Schicht, das dauerhafte Vorhalten häufig genutzter Experten im Speicher, das vorausschauende Nachladen der in der nächsten Schicht voraussichtlich benötigten Experten, das Zusammenfassen der von mehreren Tokens benötigten Experten zu einem einzigen Lesevorgang, die Überlappung von Festplattenzugriff und Berechnung sowie die Unterstützung von parallelem Striping über zwei SSDs.

Im README wird der Kompromiss bei der Geschwindigkeit offen benannt: Reicht der schnelle Speicher nicht aus, wird das System langsamer – die Modellgenauigkeit sinkt dadurch nicht. Für die Geschwindigkeit selbst gibt es „keinerlei Garantie".

Wie schnell läuft es tatsächlich

Das Projekt nennt mehrere gemessene Werte:

  • 6× RTX 5090, alle Gewichte dauerhaft im Speicher: 5,8 bis 6,8 Tokens pro Sekunde
  • Reiner CPU-Desktop mit 128 GB RAM, nach Cache-Aufwärmung: rund 1,8 pro Sekunde
  • Einzelne RTX 5070 Ti: 1,07 pro Sekunde
  • Entwicklungsrechner des Autors mit 25 GB RAM, Kaltstart: 0,05 bis 0,1 pro Sekunde

Version 1.11.0 von Mitte September brachte Unterstützung für DeepSeek V4.1 Flash mit 552 Milliarden Parametern und 510 GB Speicherbedarf, das auf einer reinen CPU-Maschine die offiziellen Gewichte direkt liest, ohne Formatkonvertierung. Laut Aufzeichnungen des Autors sank die Kaltstart-Latenz einer einzelnen Runde von 78,7 auf 25,1 Sekunden, bei fünf aufeinanderfolgenden Dialogrunden stabilisierte sich der Durchsatz bei 1,14 bis 1,58 Tokens pro Sekunde.

Die wichtigste neue Funktion von 1.12.0 heißt Brio-Modus: Der Aufrufer gibt eine begrenzte Auswahl möglicher Antworten vor, aus der die Engine direkt die Wahrscheinlichkeit jeder Option ausliest, statt Text durch Sampling zu erzeugen – die Anzahl der generierten Tokens ist null, und die Antwort kann die vorgegebenen Optionen nicht verlassen. Für die meisten lokalen Nutzer ist das deutlich praktischer, als Wort für Wort auf eine Antwort zu warten.

Die Liste unterstützter Modelle liest sich fast wie ein Verzeichnis chinesischer offener Modelle

Colibrì unterstützt derzeit neun Modellfamilien: GLM-5.2/5.3 sowie das vision-fähige GLM-5.3-Flash, DeepSeek V4 Flash und V4.1 Flash, Kimi K3, Qwen3.6 und Qwen3.8-Flash-Next sowie zusätzlich Inkling und OLMoE. Mit Ausnahme der letzten beiden stammen sie alle von den chinesischen Unternehmen Zhipu, DeepSeek, Moonshot AI und Alibaba.

Für Entwickler in China hat das einen doppelten Nutzen. Erstens verlässt die Daten die eigene Maschine nicht: In Anwaltskanzleien, Krankenhäusern oder produzierenden Unternehmen, wo Dokumente nicht in die Cloud übertragen werden dürfen, reicht eine Workstation mit 128 GB RAM und einer 1-TB-SSD aus, um ein GLM-Modell mit 744 Milliarden Parametern lokal laufen zu lassen. Zweitens sinkt die Einstiegshürde: Für ein Modell wie Kimi K3 mit 2,8 Billionen Parametern, dessen int4-Gewichte rund 1,6 TB belegen und mindestens 32 GB RAM erfordern, war es zuvor für Einzelpersonen praktisch unmöglich, es auf der eigenen Maschine zum Laufen zu bringen.

Die Grenzen sind ebenso deutlich. Bei ein bis zwei Tokens pro Sekunde dauert eine tausend Wörter lange Antwort mehr als zehn Minuten; wie stark häufiges, intensives wahlfreies Lesen die Lebensdauer einer SSD verkürzt, beziffert die Projektdokumentation nicht. Der Autor selbst weist zudem darauf hin, dass die gemessenen Beschleunigungseffekte durch spekulative Dekodierung empirische Werte sind, die sich auf einer anderen Maschine nicht zwangsläufig reproduzieren lassen.

Quellen: Colibrì-Projekt-README, Versionshinweise Colibrì 1.11 bis 1.12.1, QbitAI, CocoLoop; Geschwindigkeitsangaben laut den vom Projekt veröffentlichten Testkonfigurationen, Stern-Zahlen von der GitHub-Seite.