Inkling Small, 975B 플래그십에 근접

Thinking Machines는 7월 30일 Inkling-Small을 공개했다. 총 파라미터는 276B, 활성 파라미터는 12B이며 텍스트, 이미지, 오디오 입력을 받는다. 웨이트도 공개됐다.

공식 발표에 따르면 이 모델은 Inkling 이후 훈련을 시작해 데이터 배합과 훈련 레시피를 개선했다. Inkling을 교사로 삼은 on-policy distillation 뒤에 2주간의 에이전트 코딩 RL도 이어졌다.

“Inkling-Small’s combination of broad performance and efficiency will make it easy to experiment with and test in real applications.”

작아진 것은 비용 구조다

모델 카드는 42층 decoder-only Transformer, 256개 전문가 중 6개로 라우팅되는 sparse MoE, 2개의 공유 전문가, 최대 100만 토큰 컨텍스트, Apache 2.0 라이선스를 적고 있다.

배포 조건은 여전히 무겁다. vLLM Recipes 기준 NVFP4는 최소 180GB 집계 VRAM, BF16은 최소 600GB가 필요하다. 하지만 36Kr/신즈위안이 언급한 원래 Inkling의 2TB급 구성보다는 평가 가능한 팀의 폭이 넓다.

강한 점수와 남은 빈틈

공식 표에서 Inkling-Small은 SWE-bench Verified 80.2%, Terminal Bench 2.1 64.7%, HLE text only 31.6%, ARC-AGI-2 40.1%를 기록했다. 같은 표의 Inkling보다 높은 항목들이다.

Artificial Analysis는 Intelligence Index에서 40점으로 평가했다. Inkling의 41점과 1점 차이며, 같은 크기 이하의 오픈 웨이트 모델 중 더 높은 점수는 없다고 봤다. 다만 사실 지식과 일부 에이전트 업무에서는 플래그십보다 약하다고 덧붙였다.

검증은 이제 사용자 쪽으로 간다

이번 공개는 웨이트 파일 하나가 아니라 모델 카드, Hugging Face, vLLM과 SGLang 경로를 함께 묶은 배포다. 다음 확인 지점은 180GB/600GB급 환경에서 안정적으로 구동되는지, 자체 코드베이스와 RAG에서 미세조정 효과가 나는지, 외부 하네스가 공식 코딩·멀티모달 점수를 재현하는지다.

출처: 36Kr/신즈위안, Thinking Machines 공식 발표, CocoLoop, Inkling-Small 모델 카드, Artificial Analysis, Hugging Face, vLLM Recipes. 공식 자료로 공개 시점, 파라미터, 라이선스, 컨텍스트, 훈련과 벤치마크 조건을 확인했고, 제3자 자료로 배포 조건과 독립 점수를 대조했다.