OpenAI가 9월 22일 GPT-6 Sol과 GPT-6 Luna를 공개했다. API 모델 ID는 각각 gpt-6-sol, gpt-6-luna이며 당일부터 호출할 수 있다. 두 모델 모두 가격은 전 세대인 GPT-5.6 대응 모델의 절반이며, 컨텍스트 윈도는 110만 토큰이다. ChatGPT 쪽에서는 Work, Pro, Business, Enterprise, Edu 요금제에서 두 모델을 쓸 수 있고, Luna는 데스크톱 무료 버전과 Go 버전에도 적용된다. Codex도 ChatGPT Work와 함께 업데이트된다. OpenAI는 가중치를 공개하지 않았으며 두 모델 모두 API로만 제공된다.
공식 발표 성능
OpenAI는 발표 자료에서 다음과 같은 벤치마크 결과를 제시했다.
- AutomationBench 1.0.6(전문 업무 작업): Sol은 xhigh 추론 단계에서 정확도 33.2%, 작업당 비용 0.27달러를 기록했다. Luna는 high 단계에서 이전 세대보다 5.4점 높았고 비용은 58% 낮았다.
- DeepSWE v1.1(코딩): Sol은 max 단계에서 68.8%, Luna는 66.6%를 기록했다.
- OSWorld 2.0 오프라인 버전(컴퓨터 조작): Sol은 xhigh 단계에서 60.5%로, OpenAI는 이를 Opus 5의 중간 단계와 비슷한 수준이면서 비용은 80% 낮다고 설명했다. Luna는 max 단계에서 이전 세대 Sol을 넘어섰고 비용은 약 10분의 1이다.
- Agents' Last Exam: Sol은 max 단계에서 56.4%를 기록했다.
이번 출시에는 개선된 프롬프트 캐싱 시스템도 함께 적용됐다. OpenAI에 따르면 에이전트는 매 턴마다 같은 지시문, 도구 정의, 이력을 다시 전송하는데, 새 시스템은 기본적으로 캐시 적중률을 높여 캐시 읽기 비용을 최대 90%까지 낮춘다.
제3자 검증: 가격은 내렸지만 점수는 그대로
Artificial Analysis의 자체 재검증 결과는 성능 면에서 OpenAI의 발표 자료와 차이를 보였다. 이 기관은 두 모델의 인텔리전스 지수와 코딩 에이전트 지수가 GPT-5.6과 대체로 비슷하다고 밝혔다. 코딩 에이전트 지수에서 Sol은 max 단계 57점으로 이전 세대보다 2점 높았고, Luna는 41점으로 이전 세대보다 2점 낮았다.
이번 발표의 핵심은 오히려 비용 쪽에 있다. 같은 인텔리전스 지수 벤치마크에서 Sol은 max 단계 기준 작업당 1.06달러(이전 세대 1.99달러), Luna는 0.07달러(이전 세대 0.18달러)였다.
비용을 계산해 보면
Artificial Analysis의 수치를 단순 대입하면, 하루에 비슷한 작업을 1만 건 처리하는 팀이 Sol을 쓸 경우 하루 약 9300달러, 한 달이면 28만 달러 가까이 절감하는 셈이다. Luna 같은 경량 모델로 바꾸면 같은 작업량의 비용이 하루 1800달러에서 700달러로 줄어든다. 이는 벤치마크 비용 수치를 그대로 대입한 결과이며, 실제 청구액은 작업 길이, 추론 단계, 캐시 적중률에 따라 달라진다. 특히 캐시 적중률은 같은 시스템 프롬프트를 반복 전송하는 에이전트 애플리케이션에서 10%포인트 오를 때마다 단가 인하보다 더 큰 절감 효과를 낼 수 있다.
같은 날 Anthropic도 Claude Opus 5.5를 공개했는데, 전체 운영 비용이 Opus 5보다 40% 낮고 가격은 입력 100만 토큰당 4달러, 출력 20달러다. 두 회사가 같은 날 플래그십 모델 가격을 낮춘 셈으로, Sol의 단가는 Opus 5.5의 절반이고 Luna는 경량 모델 가격대를 0.10달러까지 끌어내렸다.
중국 개발자 입장에서는 이번 가격 인하의 실질적 영향이 호출 경로에 따라 달라진다. 공식 API를 직접 쓰는 팀은 인하분을 그대로 누리지만, 중계 서비스나 클라우드 업체 채널을 거치는 경우 마진 비율이 함께 조정될지는 각 업체의 발표를 지켜봐야 한다. 작업당 비용으로 과금하는 에이전트형 제품은 수익 구조에 먼저 영향을 받을 전망이다. 같은 기능에서 추론 비용이 절반으로 줄면 그동안 호출 횟수를 제한해 비용을 관리하던 설계에 여유가 생기지만, 경쟁사도 동시에 같은 여유를 얻게 된다.
참고 출처: OpenAI 발표 자료, Artificial Analysis 검증 기사, CocoLoop, MarkTechPost. 제3자 검증은 작업당 비용과 코딩 에이전트 지수 점수를 확인한 것이다.