올해 2월, xAI는 Grok 4.20을 출시했다. Grok 5가 아니라 구조적으로 완전히 다른 제품이다. 하나의 모델 안에서 역할이 분담된 네 개의 에이전트가 서로 질문하고 토론한 뒤 최종 답변을 합성하는 방식이다.
이 아이디어는 다소 낯설게 들리지만, 그 뒤에는 구체적인 엔지니어링 설계가 있다.
네 가지 역할, 하나의 두뇌
먼저 구조를 살펴보자. Grok 4.20은 네 개의 독립적인 모델이 아니라 약 3조 파라미터의 MoE 베이스 모델로, 추론마다 약 5000억 파라미터를 활성화한다. 네 에이전트는 LoRA 스타일의 경량 어댑터 레이어를 통해 이 베이스 모델 위에서 작동한다. 본질적으로 동일한 모델의 네 가지 '성격'인 셈이다.
네 가지 역할은 다음과 같다.
- Grok(캡틴): 작업 분해, 전체 전략 수립, 최종 통합 출력
- Harper(연구원): 실시간 검색 및 사실 확인, X 플랫폼 정보 스트림에 광범위하게 접근
- Benjamin(논리 전문가): 단계별 추론, 수학 계산, 코드 생성 및 검증
- Lucas(반대론자): 편향 식별, 결론에 대한 의문 제기, 과신 방지 — 결함을 찾는 데 특화
충분히 복잡한 문제가 발생할 때마다 네 에이전트는 다음 프로세스를 따른다. 작업 분해 → 병렬 분석(공유 KV 캐시) → 다중 라운드 토론 → 최종 합성.
토론은 쇼가 아니다. Lucas의 존재 이유는 Grok과 Benjamin이 가질 수 있는 확증 편향을 깨기 위해서다.
환각률 수치가 놀랍다
환각률은 Grok 4.1의 12%에서 4.2%로 65% 감소했다.
4%는 현재 대규모 모델 중에서 상당히 낮은 수준이다. OpenAI와 Anthropic의 플래그십 모델은 대략 5~8% 범위에 있다.
기타 지표:
| 지표 | Grok 4.20 |
|---|---|
| IFBench(명령어 준수) | 83%, 1위 |
| 추론 속도 | 220.5 토큰/초 |
| SWE-bench(코딩) | 75% |
| Intelligence Index | 8위, 점수 48 |
| 컨텍스트 윈도우 | 200만 토큰 |
코딩 75%는 Claude Opus 4.6의 80.8%에 미치지 못한다. 종합 순위는 8위이며, GPT-5.4는 57점으로 격차가 있다. 따라서 Grok 4.20은 '가장 똑똑한' 차원에서는 1위를 차지하지 못했지만, '가장 신뢰할 수 있는 발언' 측면에서는 경쟁력을 갖췄다.
공유 베이스 모델이 멀티 모델 협업보다 나은 이유
멀티 에이전트 프레임워크 자체는 새로운 것이 아니다. LangGraph, AutoGen 등은 이미 오래전부터 존재했다. 그러나 xAI의 접근 방식에는 결정적인 차이가 있다. 여러 독립 모델을 협업시키는 대신, 동일한 베이스 모델 위에서 여러 역할을 실행한다는 점이다.
장점은 다음과 같다.
- KV 캐시를 공유하므로 지연 시간이 훨씬 낮다
- 모델 간에 대량의 컨텍스트를 전달할 필요가 없어 정보 손실이 줄어든다
- 모든 에이전트가 동일한 입력에 대해 동일한 기초 이해를 공유한다
다시 말해, 기존의 '멀티 에이전트'는 여러 사람이 협력하여 문제를 푸는 것과 같았다면, Grok 4.20은 한 사람의 머릿속에서 네 가지 사고 모드가 동시에 돌아가는 것과 같다.
인프라
이 시스템은 멤피스에 있는 xAI의 Colossus 슈퍼컴퓨터에서 구동된다. 30만 개 이상의 GPU, 전력 소비 2GW, 메모리 대역폭 194PB/s. 200만 토큰 컨텍스트 윈도우는 대규모 코드베이스와 수년간의 문서를 담을 수 있다.
세부 사항으로, xAI는 토론 라운드 수가 고정인지 적응형인지 아직 공개하지 않았다. 이 부분의 엔지니어링 세부 사항은 블랙박스로 남아 있다.
가격 및 접근
- API: 입력 $2/M, 출력 $6/M
- 일반 사용자: SuperGrok 구독(약 $30/월) 또는 X Premium+
가격은 Claude Opus 4.6보다 비싸고 GPT-5.4보다는 약간 저렴하다.
이 방향은 연구할 가치가 있다
환각률의 대폭적인 감소는 AI가 '자기 의심'을 하게 하는 메커니즘이 공학적으로 효과적임을 보여준다. 이는 단순히 파라미터를 쌓는 것보다 더 가치 있는 방향일 수 있다.
그러나 아직 해결되지 않은 몇 가지 질문이 남아 있다. 토론 라운드의 제어 로직은 무엇인가? Lucas의 의문 제기가 과도한 보수성으로 이어질 가능성은 없는가? xAI는 이에 대해 공개하지 않았다.
아키텍처에 대해 공개된 범위 내에서, 이것은 4개 에이전트 토론을 통합 베이스 모델과 공유 KV 캐시로 구현한 최초의 상용 제품이다. 이 접근 방식이 효과적임이 입증된다면, 다른 대형 업체들이 따라오는 것은 시간 문제일 것이다.
출처: Inside Grok 4.20: How Four Agents on One Backbone Beat Separate Models(Medium, Engineer at Heart);CocoLoop、Grok 4.20 Beta Launch: 4-Agent AI System Launches(adwaitx.com);HOW THE XAI GROK 4.20 AGENTS WORK(NextBigFuture.com);Master the 5 Core Capabilities of Grok 4.20(Apiyi.com)