Colibrì, SSD 활용해 16GB 메모리로 GLM-5.2 구동

깃허브에서 스타 3만 7000개, 포크 4000개를 넘어선 오픈소스 추론 엔진 Colibrì가 화제다. 하는 일은 단순하다. 수천억에서 1조 개가 넘는 파라미터를 가진 MoE 대형 모델을, 일반인의 컴퓨터에서 돌아가게 만드는 것이다. 즈푸(Zhipu AI)의 GLM-5.2를 예로 들면, 프로젝트가 제시한 최소 사양은 메모리 16GB, 권장 사양은 24GB이며 GPU는 없어도 된다.

이 프로젝트는 Vincenzo Fornaro가 7월 1일 만들었으며, 순수 C 언어로 작성됐고 외부 의존성이 전혀 없다. 라이선스는 Apache 2.0이다. 9월 20일 배포된 1.12.0 버전에서는 풀 리퀘스트 81건이 병합됐고, 9월 24일 1.12.1 버전에서는 96건이 추가로 병합됐는데 이 중 80건이 외부 기여자의 것이었다.

가중치는 디스크에 두고, 필요한 층만 읽는다

MoE 모델은 전체 파라미터 수는 많지만 토큰 하나당 실제로 쓰는 양은 적다는 특징이 있다. GLM-5.2는 전체 파라미터가 7440억 개인데, 한 번 호출할 때 활성화되는 것은 약 400억 개뿐이다. Colibrì는 모델 전체를 메모리에 올리지 않고, int4로 양자화한 전체 가중치를 NVMe SSD에 두는 방식을 택했다. GLM-5.2는 약 372GB, GLM-5.3은 약 419GB를 차지한다.

이 프로젝트는 VRAM·메모리·SSD를 하나로 통합된 저장 계층으로 다루며, 개발자는 이를 "가중치의 즉시 컴파일"이라고 부른다. 구체적인 기법으로는 계층별 최근 최소 사용(LRU) 캐시, 자주 쓰이는 전문가(expert)를 메모리에 상시 고정, 다음 계층에서 쓰일 것으로 예상되는 전문가를 한 계층 앞서 미리 불러오는 프리페치, 여러 토큰이 필요로 하는 전문가를 한 번의 디스크 읽기로 합치는 것, 디스크 읽기와 연산을 겹쳐서 처리하는 것, 그리고 SSD 두 개에 걸친 스트라이핑 병렬 읽기 지원 등이 있다.

README에는 속도에 대한 트레이드오프가 명시돼 있다. 빠른 스토리지가 부족하면 느려질 뿐 모델 정확도는 떨어지지 않으며, 속도 자체는 "어떤 것도 보장하지 않는다"고 밝혔다.

실제로 얼마나 빠른가

프로젝트가 공개한 실측 수치는 다음과 같다.

  • RTX 5090 6장, 가중치 전부 상주: 초당 5.8~6.8개 토큰
  • 메모리 128GB의 CPU 전용 데스크톱, 캐시 예열 후: 초당 약 1.8개
  • RTX 5070 Ti 단일: 초당 1.07개
  • 개발자의 메모리 25GB 개발용 컴퓨터, 콜드 스타트: 초당 0.05~0.1개

9월 중순 배포된 1.11.0 버전은 DeepSeek V4.1 Flash(파라미터 5520억 개, 디스크 사용량 510GB)를 지원하기 시작했으며, CPU 전용 기기에서 공식 가중치를 그대로 읽고 포맷 변환은 하지 않는다. 개발자가 기록한 바에 따르면 콜드 스타트 시 한 턴에 걸리는 시간이 78.7초에서 25.1초로 줄었고, 5턴 대화에서는 초당 1.14~1.58개 토큰으로 안정됐다.

1.12.0의 핵심 신기능은 brio 모드다. 호출하는 쪽이 정해진 선택지를 주면 엔진은 텍스트를 샘플링해 생성하는 대신 각 선택지의 확률을 바로 읽어낸다. 출력 토큰 수는 0이 되고, 답이 주어진 선택지를 벗어날 수 없다. 대다수 로컬 사용자에게는 한 글자씩 답을 기다리는 것보다 훨씬 실용적이다.

지원 모델 목록은 사실상 중국산 오픈모델 명단

Colibrì는 현재 9개 모델 계열을 지원한다. GLM-5.2/5.3과 비전 기능이 있는 GLM-5.3-Flash, DeepSeek V4 Flash와 V4.1 Flash, Kimi K3, Qwen3.6과 Qwen3.8-Flash-Next, 그리고 Inkling과 OLMoE다. 마지막 둘을 제외하면 모두 즈푸(Zhipu AI), DeepSeek, 문지암몐(Moonshot AI), 알리바바 등 중국 기업 소속이다.

중국 내 개발자에게는 두 가지 실용적 의미가 있다. 하나는 데이터를 사내에 둘 수 있다는 점이다. 로펌, 병원, 제조업체처럼 문서를 클라우드로 보낼 수 없는 곳에서도 메모리 128GB 워크스테이션에 1TB SSD 하나만 더하면 7440억 파라미터 GLM을 로컬에서 돌릴 수 있다. 다른 하나는 진입 장벽이 낮아진다는 점이다. 2조 8000억 파라미터인 Kimi K3는 int4 가중치가 약 1.6TB, 메모리 요건이 32GB 이상인데, 이전까지는 개인이 자기 컴퓨터에서 돌리는 것이 사실상 불가능했다.

한계도 뚜렷하다. 초당 한두 개 토큰의 속도로는 천 자 분량의 답변을 생성하는 데 십수 분이 걸린다. SSD에 장시간 고강도로 무작위 읽기를 반복할 때 수명이 얼마나 줄어드는지에 대해 프로젝트 문서는 추산치를 내놓지 않았다. 개발자 스스로도 추측 디코딩(speculative decoding)에 의한 가속 효과는 실측값일 뿐이며 다른 기기에서는 재현되지 않을 수 있다고 당부했다.

참고 출처: Colibrì 프로젝트 README, Colibrì 1.11~1.12.1 버전 릴리스 노트, 량쯔웨이(QbitAI), CocoLoop; 속도 수치는 프로젝트 측이 공개한 각 실측 구성을 기준으로 했으며, 스타 수는 깃허브 페이지 수치를 인용했다.