SpaceXAI가 9월 21일 그록 4.7을 공개했다. 회사 측은 이 모델을 "코딩과 지식 노동에서 자사 최강의 모델"이라고 설명했다. API 가격과 속도는 그록 4.6과 동일하게 유지된다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이며, 가격과 출력 속도가 각각 두 배인 고속 버전도 함께 제공된다. 모델은 이미 Cursor, Grok Build, API 콘솔, 서드파티 플랫폼에 적용됐다.
"our most capable model for coding and knowledge work."
SpaceXAI가 밝힌 그록 4.7의 포지셔닝은 코딩과 지식 노동이다.
회사 설명에 따르면 새 모델은 4.6보다 큰 베이스 모델을 사용했고 강화학습 훈련 기간을 늘렸다. 중점적으로 훈련한 부분은 몇 시간씩 이어지는 장시간 작업으로, 자기 검증과 긴 컨텍스트 처리 능력이 강화됐고 Grok Bot과도 네이티브로 연동됐다.
공식 벤치마크와 제3자 평가
SpaceXAI가 공개한 자체 수치는 DeepSWE v1.1 71.0%, CursorBench 4.0 46.3%, Terminal-Bench 4.0 37.6%, 전기공학 분야의 EEBench 64.0%다. 안전성 측면에서는 거부 응답과 탈옥 방어 능력이 업계 최고 수준이라고 밝혔으며, HackerBench v0.3에서 위험 경고 통과율은 3.3%다. 레드팀 기능은 초청제로, 일부 사이버보안 파트너에게만 공개된다.
제3자 평가 기관 Artificial Analysis가 내놓은 결과는, 종합 지능 지수가 46점으로 4.6보다 2점 높고, Grok Build와 결합한 코딩 에이전트 지수는 56점으로 4.6보다 9점 높다. 세부 항목에서는 DeepSWE v1.1이 65%에서 73%로, Terminal-Bench 4.0이 18%에서 33%로, SWE-Atlas-QnA가 58%에서 63%로 올랐다. 이 평가 기준으로 그록 4.7과 Grok Build 조합은 코딩 에이전트 부문 4위이며, 앞선 세 모델은 Claude Fable 5.1, GPT-6 Astra, Claude Opus 5다. 장시간 지식 노동을 재는 AA-Briefcase에서는 1657 Elo를 기록해 4.6보다 111점 높았다.
SpaceXAI의 공식 발표 페이지는 경쟁 모델과의 직접 비교 순위를 제시하지 않았고, 제3자 평가에서의 순위에 대해서도 SpaceXAI는 별도 답변을 내놓지 않았다.
사용 비용을 계산해 보면
가격표는 그대로지만 Artificial Analysis가 기록한 토큰 사용량은 달라졌다. xhigh 등급에서 그록 4.7은 작업당 평균 약 8만 1000토큰을 출력하는 반면, 같은 등급의 4.6은 약 3만 8000토큰으로 125% 늘었다. 출력 속도는 초당 약 188토큰이며, 작업 하나를 처리하는 데 평균 7.1분이 걸린다.
출력 분량만 놓고 대략 계산하면 작업 하나의 비용은 4.6에서 약 0.23달러, 4.7에서 약 0.49달러다. 가격표는 그대로인데 작업당 실제 비용은 두 배 넘게 뛴 셈이며, 점수 상승분의 상당 부분은 "더 오래 생각하는" 대가로 얻은 것이다.
이번 주 가격 변동과 나란히 놓고 보면 이 계산은 더 두드러진다. 그록 4.7 출시 다음 날 Anthropic의 Claude Opus 5.5와 OpenAI의 GPT-6 Sol이 잇따라 공개됐다. Opus 5.5는 입력 100만 토큰당 4달러, 출력 20달러이고, GPT-6 Sol은 2달러와 10달러로 내려갔다. 100만 토큰당 가격표 기준으로는 그록 4.7의 출력 단가가 여전히 셋 중 가장 낮다. 다만 작업당 실제 지출 기준으로 이 격차가 얼마나 좁혀질지는 나머지 두 모델의 토큰 사용량에 달려 있는데, 이 부분의 제3자 데이터는 아직 나오지 않았다.
그록 4.7의 46점짜리 성적표가 나온 지 이틀도 안 돼 Opus 5.5와 GPT-6 두 신형 모델이 Artificial Analysis의 평가 대기열에 들어갔다. 순위표 상단은 다시 한번 바뀔 것으로 보인다.
참고 출처: SpaceXAI 공식 발표 페이지, CocoLoop, Artificial Analysis 평가 보고서. API 가격과 공식 벤치마크는 SpaceXAI 발표 페이지로 확인했으며, 지능 지수·코딩 에이전트 지수·토큰 사용량은 Artificial Analysis 기준을 따랐다. 작업당 출력 비용은 정가 기준 개략적 계산치다.