리퀴드AI, 3억대 드래프트로 최대 3.18배 가속
리퀴드AI가 허깅페이스에 LFM2.5-DSpark 드래프트 모델을 공개, 온디바이스 모델 3종에 추측 디코딩을 적용해 출력은 그대로 두고 최대 3.18배 속도를 높였다.
AI 추론 관련 제품 동향과 산업 분석 11건을 모았습니다.
리퀴드AI가 허깅페이스에 LFM2.5-DSpark 드래프트 모델을 공개, 온디바이스 모델 3종에 추측 디코딩을 적용해 출력은 그대로 두고 최대 3.18배 속도를 높였다.
Tencent Hunyuan이 AngelSpec을 공개하며 speculative decoding drafter 훈련, 평가, 가중치와 배포 경로를 함께 제시했다.
DeepSeek와 베이징대는 생성 속도를 60~85% 높이고 단일 GPU 처리량을 최대 6.6배 끌어올릴 수 있는 추론 프레임워크 DSpark를 오픈소스로 공개했다.
샤오미 MiMo, 일반 GPU에서 초당 1000토큰 주장. 발표 내용과 전략적 맥락, 영향을 받는 이용자와 기업의 실질적 위험을 정리한다.
Tensormesh가 AMD Ventures, NVentures, CoreWeave 등으로부터 2000만 달러를 투자 받아 KV 캐시 플랫폼을 상용화, GPU 낭비를 줄인다.
MiniMax가 추론 모델 시리즈 M1을 공개했다. OpenAI의 o 시리즈와 DeepSeek의 R1을 겨냥하며 수학 추론, 코드 생성, 논리 분석에서 강력한 성능을 보여준다. M2.5는 SWE-bench Verified에서 80.2%를 기록했다.
OpenAI, DeepSeek, Google, Anthropic의 주요 AI 추론 모델을 종합 비교합니다. 각사의 접근 방식, 추론 깊이와 응답 속도 간의 트레이드오프, 오픈소스 대 폐쇄소스 현황을 살펴봅니다.
OpenAI의 GPT-5.2가 ARC-AGI-1에서 72%, ARC-AGI-2에서 18%를 기록하며 현재 LLM과 진정한 범용 지능 간의 격차를 드러냈다.
딥시크가 2026년 1월 추론 모델 R1을 오픈소스로 공개했다. 수학, 코드, 논리 추론 벤치마크에서 오픈AI의 o1과 비슷한 점수를 기록했으며, 증류 버전인 32B 파라미터 모델은 여러 테스트에서 o1-mini를 능가했다.
Google이 역대 가장 지능적인 모델이라고 공식 발표한 Gemini 2.5 Pro를 출시했습니다. 수학, 과학, 코드, 멀티모달 벤치마크에서 최고 점수를 기록했지만, 심층 추론으로 인해 응답 속도가 느려지는 문제가 있습니다.
Anthropic이 2월 5일 Opus 4.6을 출시했습니다. 질문 복잡도에 따라 추론 깊이를 동적으로 조정하는 어댑티브 싱킹, 100만 토큰 컨텍스트 윈도우, 이론상 무제한 대화를 지원하는 Compaction API가 핵심입니다.