Anthropic은 10월 7일 Claude Haiku 5.5를 출시했다. Claude 5세대의 첫 소형 모델로, 이전 Haiku는 4.5에 머물러 있었다. 신모델은 당일 Claude Platform에 올라갔고, 동시에 AWS, Google Cloud, Microsoft Azure에도 배포됐다. Claude Code도 같은 날 배포된 버전에 이 모델을 추가했다.
공식이 제시한 용도는 좁다. 높은 처리량이 필요한 배치 작업, 그리고 대형 모델이 호출하는 서브 에이전트 용도다. 이번 발표의 주인공은 가격이다.
프롬프트 길이에 따른 2단계 가격
Haiku 5.5는 한 번의 프롬프트 길이를 기준으로 가격을 2단계로 나누는데, 기준선은 10만 토큰이다.
| 100만 토큰당 | Haiku 5.5(10만 이하) | Haiku 5.5(10만 초과) | Haiku 4.5 |
|---|---|---|---|
| 입력 | 0.10달러 | 0.50달러 | 1.00달러 |
| 출력 | 0.50달러 | 2.50달러 | 5.00달러 |
| 캐시 읽기 | 0.01달러 | 0.05달러 | 0.10달러 |
| 캐시 쓰기 | 0.125달러 | 0.625달러 | 1.25달러 |
짧은 프롬프트 구간에서는 모든 단가가 Haiku 4.5의 10분의 1이고, 긴 프롬프트 구간에서는 절반이다. Anthropic 측 설명으로는 전체 운영 비용이 평균 약 75% 낮아진다고 한다.
짧은 구간의 입력·출력 가격은 OpenAI가 9월 하순에 내놓은 GPT-6 Luna와 완전히 같다. 두 회사의 소형 모델이 가격표상에서 같은 선에 자리 잡은 셈이다.
같은 날 Anthropic은 Sonnet 5.5의 캐시 읽기 가격을 100만 토큰당 0.20달러에서 0.10달러로 내렸고, 구독자에게 API 크레딧도 지급했다. Max 5x는 월 100달러, Max 20x는 월 200달러, Team 요금제는 팀 전체 합산 최대 월 500달러다. 개발자 Simon Willison은 블로그에서 이 크레딧은 해당 달에 다 쓰지 않으면 다음 달로 넘어가지 않는다고 지적했다.
벤치마크와 추론 단계
Haiku 5.5는 추론 기능이 기본 내장돼 있어 끌 수는 없지만, low, medium, high, xhigh, max 다섯 단계로 조절할 수 있다. 기본값은 medium이다. 공식이 공개한 성적으로는 컴퓨터 조작 테스트인 OSWorld 2.1 오프라인 서브셋에서 72.4%, Terminal-Bench 4.0에서 39.2%, Humanity's Last Exam에서는 도구 미사용 45.9%, 도구 사용 57.4%를 기록했다.
일부 초기 고객은 자체 내부 수치를 공개했다. Box는 새 모델이 자사 테스트셋에서 Haiku 4.5보다 11점 높았고, 지연 시간은 약 절반이었다고 밝혔다.
"Claude Haiku 5.5 scored 11 points higher than Haiku 4.5 at about half the latency."
(Claude Haiku 5.5는 Haiku 4.5보다 11점 높았고, 지연 시간은 약 절반이었다.)
Asana는 지연 시간이 30% 이상 줄었다고 보고했고, HubSpot은 이 테스트에서 본 가장 높은 점수인 92.8%를 기록했다고 밝혔다. 이 수치들은 모두 고객사 자체 측정 결과이며, 테스트 문항 자체는 공개되지 않았다.
추론 단계는 비용에 큰 영향을 준다. Simon Willison은 같은 '자전거를 탄 펠리컨을 그려라'라는 프롬프트를 최저 단계와 최고 단계로 각각 시험했다. low 단계는 약 0.0009달러, 7초가 걸렸고, max 단계는 약 0.034달러, 5분 9초가 걸려 1회 비용 차이가 30배 이상 났다.
대략 계산: 토크나이저가 인하분 일부를 갉아먹는다
가격표 밖에도 놓치기 쉬운 변수가 있다. Simon Willison은 Haiku 5.5가 토크나이저를 바꾸면서 같은 텍스트라도 쪼개지는 토큰 수가 Haiku 4.5의 약 1.25배가 됐다고 짚었다.
이 비율로 대략 계산하면, 짧은 프롬프트 구간의 실질 입력 비용은 '옛 토큰' 100만 개당 0.125달러에 해당해, Haiku 4.5의 1달러와 비교하면 약 87% 인하로 여전히 크다. 긴 프롬프트 구간은 그만큼 좋지 않다. 0.50달러에 1.25를 곱하면 0.625달러가 돼 인하율이 약 37%로 줄어든다.
기본으로 켜져 있는 추론까지 더하면 출력 토큰은 추론을 쓰지 않는 Haiku 4.5보다 다소 늘어나며, 그 정도는 단계와 작업에 따라 다르다. 벤치마크, 추출, 라우팅처럼 짧은 입력이 중심인 작업을 하는 팀이라면 모델을 바꾸는 것만으로 거의 그대로 비용을 아낄 수 있다. 긴 문서나 긴 컨텍스트를 자주 다루는 경우라면, 전환 전에 자사 트래픽으로 한 번 계산해 보는 게 낫다.
안전성 면에서 공식은 Haiku 5.5의 사이버보안 관련 요청 제한이 Haiku 4.5와 Sonnet 5.5 사이에 있고, 생물학 분야 방어는 Sonnet 5 계열과 같다고 밝혔다. 관련 연구는 별도로 검증 자격을 신청해야 한다.
참고 출처: Anthropic Claude Haiku 5.5 제품 페이지, Simon Willison 블로그, CocoLoop, SiliconANGLE; 가격표의 두 단계 단가와 캐시 가격, Haiku 4.5와의 비교는 Anthropic 공식 가격 페이지로 확인했고, Sonnet 5.5 캐시 읽기 가격 인하는 공식 발표를 기준으로 했다.