InclusionAI의 새 Ling 소형 모델은 또 하나의 효율 모델처럼 보인다. 실제 목표는 로컬 에이전트의 실행 기반에 더 가깝다.
8월 11일 Ant Group의 Ling 팀은 Ling-3.0-tiny를 오픈소스로 공개했다. 중국 매체 Jiemian은 총 7.9B 파라미터, 토큰당 1.3B 활성 파라미터, BF16·FP8·INT4 세 가지 가중치 제공을 전했다. Hugging Face 모델 카드, ModelScope 페이지, SGLang 문서는 더 구체적인 배포 조건을 보여준다.
“We are introducing Ling-3.0-tiny, a lightweight hybrid reasoning MoE model”
작은 모델이 에이전트를 말하는 이유
Ling-3.0-tiny는 Kimi Delta Attention과 Multi-Head Latent Attention을 3:1로 번갈아 쌓는다. Sparse MoE FFN에는 128개의 라우팅 전문가가 있고, 각 토큰은 8개의 라우팅 전문가와 1개의 공유 전문가를 활성화한다.
목표는 긴 컨텍스트, 낮은 메모리, 도구 호출형 작업을 함께 맞추는 것이다. 작은 채팅 모델은 저렴하지만 긴 코딩 세션, 도구 호출, 다단계 판단에서는 계획과 컨텍스트가 쉽게 흔들린다. Ling-3.0-tiny는 단발성 채팅보다 에이전트 워크플로를 겨냥한다.
이번 발표의 핵심은 로컬 배포
모델 카드는 NVIDIA DGX Spark, Apple Silicon MacBook, Mac mini에서 검증했다고 설명한다. FP8 기준 DGX Spark에서는 약 100-105 tokens/s, M4 Pro MacBook에서는 약 86-90 tokens/s이며, 8K 컨텍스트에서 피크 메모리는 약 8.34 GiB다.
이 수치는 개발자가 실제로 보유한 장치에서 추론형 로컬 에이전트를 실행할 가능성을 보여준다. 데이터는 기기 안에 머물 수 있고, 비용은 클라우드 token 과금에서 하드웨어와 전력으로 이동한다.
제약도 분명하다. SGLang의 저지연 레시피는 256K YaRN 컨텍스트와 NEXTN 추측 디코딩에 141GB급 GPU 또는 단일 Blackwell 노드를 언급한다. MacBook 속도는 FP8, 로컬 하드웨어, 8K 컨텍스트 기준이다.
벤치마크는 위치를 정한다
모델 카드는 Artificial Analysis Intelligence Index v4.1.1 점수 25, Agentic Index 점수 16을 제시한다. 해당 테스트에서 출력 속도는 160 tokens/s를 넘고, 추론 시간을 포함한 500-token 응답 지연은 약 18초다.
이는 플래그십 모델 점수가 아니다. 가치는 활성 파라미터당 실용성에 있다. 같은 플랫폼에서 Ling-3.0-flash가 더 높은 점수를 받지만 규모도 훨씬 크다. tiny 버전은 로컬에서 상주하고 도구를 호출하며 긴 작업을 수행하는 실행 커널에 가깝다.
이제 볼 지점은 SGLang과 vLLM 지원의 안정화, INT4 버전의 소비자 장치 성능, IDE·브라우저 자동화·기업 내부 도구와의 결합이다. 모델 카드는 시작 방법을 제시했다. 실제 가치는 긴 작업에서 검증된다.
출처: Hugging Face 모델 카드, ModelScope, Jiemian, Artificial Analysis, CocoLoop, SGLang 문서; 7.9B 총 파라미터, 1.3B 활성 파라미터, BF16/FP8/INT4 가중치, KDA/MLA와 128 전문가 구조, DGX Spark/M4 Pro 속도, 8K 메모리 범위, Artificial Analysis 지수, SGLang 256K 배포 범위를 확인.