Llama 4, 최초로 MoE 도입…Scout·Maverick 공개
Meta가 2025년 4월 5일 Llama 시리즈 최초로 MoE 아키텍처를 적용한 Llama 4를 출시했다. Scout(활성 파라미터 17B, 1000만 토큰 컨텍스트)와 Maverick(활성 파라미터 17B, 128개 전문가, 100만 토큰 컨텍스트) 두 모델이 동시에 발표됐으며, early fusion을 통한 네이티브 멀티모달을 지원한다.
MoE 관련 제품 동향과 산업 분석 4건을 모았습니다.
Meta가 2025년 4월 5일 Llama 시리즈 최초로 MoE 아키텍처를 적용한 Llama 4를 출시했다. Scout(활성 파라미터 17B, 1000만 토큰 컨텍스트)와 Maverick(활성 파라미터 17B, 128개 전문가, 100만 토큰 컨텍스트) 두 모델이 동시에 발표됐으며, early fusion을 통한 네이티브 멀티모달을 지원한다.
Moonshot AI가 지난 7월 1조 파라미터 MoE 대규모 모델 Kimi K2를 오픈소스로 공개했다. 토큰당 32B 파라미터만 활성화되며 코딩 및 에이전트 성능에서 강점을 보인다.
DeepSeek V3.1은 회사 최초의 하이브리드 모델로, 범용 모델 V3와 추론 모델 R1의 기능을 단일 아키텍처에 결합했습니다.
DeepSeek V3는 MoE 아키텍처로 총 671B 파라미터 중 토큰당 37B만 활성화하며, 최고 수준의 오픈소스 벤치마크 점수를 달성하면서도 훈련 비용은 550만 달러에 불과합니다.