퀄컴 칩을 탑재한 스마트 안경을 겨냥해 AI 스타트업 PrismML이 소형 언어모델을 만들었다. 퀄컴은 9월 24일 스냅드래곤 서밋에서 PrismML의 1비트 모델 '본사이(Bonsai)'가 스냅드래곤 AR1 Gen 1 플랫폼에서 로컬로 구동되는 모습을 시연했다. 착용자는 눈앞의 사물에 대해 실시간으로 질문할 수 있다.
이 모델은 20억 파라미터 규모로, 시각·언어 작업에 맞춰 튜닝됐다. 테크크런치 보도에 따르면 PrismML은 자사 모델이 더 큰 모델의 4분의 1 크기이면서도 표준 벤치마크에서 대부분의 성능을 유지한다고 주장한다. 다만 비교 대상 모델이 무엇이고 어떤 벤치마크를 사용했는지는 보도에 나오지 않았다.
PrismML은 이 모델을 탑재한 상용 안경 제품을 아직 발표하지 않았다. 어느 제조사가 가장 먼저 채택할지, 출시 시점은 언제일지도 아직 알려지지 않았다.
아이폰에서 안경으로
PrismML은 칼텍(캘리포니아 공과대학) 출신 연구자들이 창업했고, 버클리대의 이온 스토이카(Ion Stoica) 교수가 자문을 맡고 있다. 이 회사는 줄곧 모델을 압축해 단말기에서 직접 구동시키는 방향을 추구해 왔다.
지난 7월에는 알리바바의 통이첸원(Qwen) 3.6 270억 파라미터 밀집 모델을 약 54GB에서 4GB 미만으로 압축해 아이폰 17 프로에서 로컬로 구동했다고 밝혔다. 이보다 앞서 내놓은 본사이 시리즈는 8B·4B·1.7B 세 가지 크기로, 1비트 가중치를 중심으로 풀프리시전 모델 대비 메모리 사용량은 14분의 1, 속도는 8배, 전력 소모는 5분의 1이라는 수치를 회사 측이 제시한 바 있다. 1비트용 백엔드인 Q1_0도 이미 llama.cpp에 병합됐다.
이번 2B 버전은 본사이 시리즈의 기존 라인업인 1.7B와 4B 사이에 위치하며, 시각 기능이 새로 추가됐다. 아이폰의 270억 파라미터에서 안경의 20억 파라미터로, PrismML은 연산 여력이 훨씬 제한적인 기기로 무게중심을 옮기고 있다.
왜 AR1 Gen 1인가
스냅드래곤 AR1 Gen 1은 퀄컴이 경량 스마트 안경을 위해 설계한 칩으로, 디스플레이가 없는 AI 안경인 레이밴 메타(Ray-Ban Meta)도 이 플랫폼을 사용한다. 안경은 배터리와 발열 여유가 크지 않아, 현재 시중 AI 안경 대부분은 시각 기반 질의응답을 스마트폰이나 클라우드에 맡기고 안경 자체는 촬영·녹음·재생만 담당한다.
모델을 로컬에서 구동하면 두 가지 직접적인 이점이 있다. 하나는 네트워크에 의존하지 않아 신호가 약한 곳에서도 쓸 수 있다는 점이고, 다른 하나는 카메라가 촬영한 영상을 업로드하지 않고 기기 안에 남길 수 있다는 점이다. 대가는 배터리 사용 시간과 성능이다. 20억 파라미터 모델이 얼마나 복잡한 질문에 답할 수 있는지, 연속 인식 시 발열과 전력 소모가 어느 정도인지는 이번 시연에서 확인되지 않았으며, 실제 제품이 나와야 검증할 수 있다.
PrismML이 내세우는 목표는 오픈웨이트 AI를 단말기에서 구동해 사용자가 이미 보유한 연산 자원을 더 잘 활용하게 함으로써, 소수의 대형 폐쇄형 AI 기업에만 의존하지 않도록 하는 것이다.
중국 시장에서도 퀄컴의 AR 계열 칩은 다수의 자국 AI 안경 제품이 채택하고 있다. PrismML의 모델은 오픈웨이트 방식을 따르고 있어, 향후 공개될 경우 중국 안경 제조사와 개발자들도 이론적으로는 직접 활용할 수 있지만, 이 2B 비전 버전을 언제 어떤 라이선스로 공개할지는 아직 회사 측이 밝히지 않았다.
참고 출처: 테크크런치, CocoLoop, 퀄컴 스냅드래곤 서밋 시연, PrismML 공식 페이지. 모델 파라미터 수, 크기 비율, 본사이 시리즈 수치는 회사 발표 기준이다.