구글 딥마인드가 9월 2일 Gemini 3.8 Flash를 공개했다. 공식 모델 카드에 따르면 이 모델은 3.7 Flash를 기반으로 하며, 개선은 소프트웨어 엔지니어링과 에이전트형 지식 작업 흐름 두 분야에 집중됐다. 직원 대상 내부 테스트 버전이 유출된 지 불과 며칠 만이다.
사양은 크게 바뀌지 않았다. 입력 컨텍스트는 최대 100만 토큰, 단일 출력 상한은 6만 4000토큰, 지식 마감 시점은 2026년 3월이며 일부 영역은 여전히 2025년 1월에 머물러 있다. 배포 채널은 한꺼번에 열렸다. Gemini 앱, AI Studio, Gemini API, Gemini Enterprise Agent Platform, Google AI Mode, 코딩 도구 Antigravity에서 모두 사용할 수 있다. 모델은 조절 가능한 노력 수준(effort level)을 지원해 개발자가 품질, 비용, 지연 시간 사이에서 직접 균형점을 찾을 수 있다.
같은 표 안의 두 얼굴
공식 비교표는 3.8 Flash를 3.7 Flash, Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol, GPT-5.6 Terra와 나란히 놓았다. 눈에 띄는 것은 가격과 성능 점수 사이의 어긋남이다.
3.8 Flash는 프로모션 가격을 그대로 유지해 입력 토큰 100만 개당 0.75달러, 출력은 3.75달러다. Claude Opus 5는 각각 5달러와 25달러로, 그 사이에 6배 넘는 격차가 있다. 이 가격 차이 아래에서 두 모델은 Terminal-bench 2.1에서 89.4 대 89.1로 사실상 동률을 이뤘다. CharXiv Reasoning은 86.2 대 83.7, HLE-Verified는 54.9 대 54.4, 금융 분석 작업은 61.4 대 58.6, Harvey 법률 워크플로는 10.0 대 6.7로 모두 3.8 Flash가 앞섰고, 장편 영상 이해에서는 87.8 대 75.4로 격차가 더 벌어졌다.
작업을 길게 늘리면 상황은 뒤집힌다. 더 일반적인 에이전트 능력을 평가하는 Terminal-bench 4.0에서 Opus 5는 51.8을 받았지만 3.8 Flash는 19.1에 그쳤다. 에이전트가 컴퓨터를 조작하는 OSWorld-2.0은 75.4 대 59.0, 지식 노동을 측정하는 GDPVal-AA v2 Elo 점수는 1824 대 1545였다. DeepSWE 같은 장기 소프트웨어 엔지니어링 작업에서는 74.0 대 71.0으로 차이가 크지는 않지만 방향은 같다.
규칙은 꽤 분명하다. 작업이 짧고 단일 턴 판단에 가까울수록 가격대의 영향은 작아지고, 작업이 길어져 모델이 스스로 상태를 유지하고 오류를 수정해야 할수록 가격대별 격차는 다시 벌어진다. 대략 계산하면 중간 복잡도의 코딩 파이프라인을 똑같이 완료할 때 3.8 Flash의 추론 비용은 Opus 5의 약 6분의 1이고 성적 차이는 1퍼센트포인트 안쪽이다. 반면 수십 단계를 연속으로 조작해야 하는 에이전트 작업으로 바꾸면, 절약한 비용이 실패 재시도로 얼마나 잠식되는지는 직접 써봐야 알 수 있다.
3.7 Flash 대비 향상 폭은 확실하다. DeepSWE는 65.3에서 71.0으로, Terminal-bench 4.0은 11.2에서 19.1로, OSWorld는 50.6에서 59.0으로 올랐고, 생물학 연구 워크플로의 고난도 구간은 43.4에서 56.5로 뛰었다. 몇 주 단위로 버전을 내는 속도를 감안하면 작지 않은 폭이다.
공지보다 먼저 알아챈 사용자들
공식 모델 카드가 올라오기도 전에 개발자 커뮤니티에서는 이미 이상한 낌새를 감지했다. 웹 버전과 Antigravity에는 여전히 3.7 Flash라고 표시돼 있는데, '너는 어떤 모델이냐'고 물으면 스스로 3.8 Flash라고 답했다는 것이다. 사용하던 중 모델 선택기에 갑자기 3.8 Flash 항목이 하나 더 나타났고, 노력 수준이 기본값으로 High에 맞춰져 있었다는 사람도 있었다.
말없이 모델을 바꿔치기하는 것은 최전선 연구소들 사이에서 흔한 관행이다. 실제 부하 상태에서 먼저 한 차례 돌려보고 문제가 생기면 언제든 되돌릴 수 있기 때문이다. 대가는 사용자 쪽이 진다. 같은 모델명 아래에서 어느 순간 동작이 바뀌면 프롬프트 효과, 토큰 소비량, 출력 스타일도 함께 달라질 수 있는데, 이는 보통 어떤 업데이트 로그에도 적히지 않는다. 토큰 단위로 정산하는 팀 입장에서는 청구서의 변동이 공지보다 먼저 찾아오는 셈이다.
커뮤니티가 처음 사용한 테스트 방법도 여전히 옛날 방식이었다. 모델에게 태양계 애니메이션을 한 번에 만들게 하거나, 펠리컨 SVG를 그리게 하는 식이다. 이런 테스트는 과학적이라 할 수는 없지만 문턱이 낮고 좋고 나쁨을 한눈에 알 수 있다는 장점이 있어, 공식 벤치마크 점수가 나오기 전까지는 종종 유일한 참고 자료가 된다. 여론도 갈렸다. 칭찬하는 사람도 있고 비판하는 사람도 있는 것은 모델이 업데이트될 때마다 늘 반복되는 풍경이다.
저렴함에는 기한이 있다
모델 카드에는 몇 가지 알려진 제한 사항도 실렸다. 이따금 응답이 느려지거나 타임아웃이 발생하는 문제는 여전히 남아 있다. 노력 수준을 높이면 모델이 성능을 끌어올리기 위해 더 많은 토큰을 쓰기 때문에 실제 비용이 표시 가격에 딱 맞춰 선형으로 움직이지는 않는다. 안전성 측면에서는 전반적으로 3.7 Flash와 비슷한 수준이라고 밝혔으며, 사람이 진행한 레드팀 테스트에서 아동 안전과 관련한 출시 기준선은 충족한 것으로 확인됐지만, 비영어권 시나리오의 안전 지표는 소폭 후퇴했다.
가격표 하단에는 작은 글씨로 한 줄이 더 붙어 있다. 3.7과 3.8 Flash의 프로모션 가격은 12월 31일에 종료되며, 내년 1월 1일부터는 입력 토큰 100만 개당 1.5달러, 출력은 7.5달러로 정확히 두 배가 된다. 이 가성비 표는 넉 달 뒤 다시 계산해야 한다.
참고 출처: Google DeepMind 모델 카드, CocoLoop, 구글 공식 성능 비교표, 개발자 커뮤니티 논의; 컨텍스트 길이, 출력 상한, 지식 마감일, 배포 채널은 모델 카드를 기준으로 확인했고, 각 벤치마크 점수와 100만 토큰당 단가는 공식 비교표에서 인용했다.