Meta는 2025년 4월 5일 Llama 시리즈 최초로 MoE(Mixture-of-Experts) 아키텍처를 채택한 Llama 4를 공개했다. 동시에 두 가지 모델이 발표됐다.
Llama 4 Scout
- 활성 파라미터: 17B / 총 파라미터: 약 109B
- 전문가 수: 16개
- 컨텍스트 윈도우: 1000만 토큰
맞다, 1000만 토큰의 컨텍스트다. 이 수치는 당시 오픈소스 모델의 기록을 갈아치웠다.
Llama 4 Maverick
- 활성 파라미터: 17B / 총 파라미터: 약 400B
- 전문가 수: 128개
- 컨텍스트 윈도우: 100만 토큰
128개의 전문가를 갖췄으며, MoE 레이어와 밀집 레이어가 번갈아 배치된다. 전문가는 절반의 레이어에서만 연산에 참여한다.
네이티브 멀티모달
두 모델 모두 early fusion을 통해 네이티브 멀티모달을 구현했다. 텍스트와 이미지는 외부 어댑터로 연결되는 것이 아니라 모델 내부에서 네이티브하게 융합 처리된다. 학습 데이터는 30조 토큰 이상이며, 200개 이상의 언어를 포함한다.
성능 수준
Maverick은 코딩, 추론, 다국어 처리, 긴 컨텍스트, 이미지 이해 영역에서 GPT-4o와 Gemini 2.0을 능가하며, 훨씬 큰 규모의 DeepSeek V3.1과도 대등한 성능을 보인다.
Scout은 보다 접근성 높은 모델로 포지셔닝됐다. 4비트 및 8비트 양자화를 지원하며 단일 GPU에서 실행 가능하다.
Llama 4 Behemoth(활성 파라미터 288B)도 발표됐지만, 당시 아직 학습 중이었으며 오픈소스로 공개되지는 않았다.
한 가지 세부 사항: Meta는 이를 '오픈소스'가 아닌 '오픈웨이트'라고 부른다. 모델 가중치는 공개되어 미세 조정이 가능하지만, 전체 학습 코드와 데이터셋은 공개되지 않았다.
출처: CocoLoop, Meta AI 공식 블로그