본문으로 건너뛰기
effidevFlutter · Cloudflare 엣지 · 클라우드 비용 최적화

하이쿠 5.5, 값은 10분의 1인데 코딩은 큰 모델 몫

effidev

키 큰 유리 막대가 화살표를 따라 낮은 막대로 줄어들고, 그 옆에서 작은 로봇이 카드 더미를 상자 세 개에 나눠 담으며, 뒤에는 커다란 기계가 어둡게 서 있는 인디고·푸시아 톤 일러스트. 이미지 속 글자는 입력 값은 10분의 1, 코딩은 큰 모델 몫

고객 문의에 자동으로 답하는 챗봇, 긴 회의록을 세 줄로 줄이는 기능, 들어온 메일을 “결제 문의”와 “버그 신고”로 나누는 분류기를 AI API로 돌리고 있다면, 이번 주에는 요금 계산을 다시 해 볼 만하다.

앤스로픽이 2026년 10월 7일 낸 클로드 하이쿠 5.5는 입력 토큰 100만 개당 값이 하이쿠 4.5의 1달러에서 0.10달러로 내렸다. 출력은 5달러에서 0.50달러다. 그런데 같은 발표문의 점수표에서 터미널 코딩 시험은 소네트 5.5의 70.6%에 못 미치는 **39.2%**이고, 앤스로픽은 복잡한 코딩 에이전트 작업에는 소네트와 오퍼스가 여전히 더 낫다고 직접 적었다. 싸졌다는 소식과 “코딩은 맡기지 말라”는 단서가 한 문서에 같이 들어 있다.

청구서를 줄이고 싶은 개발자, 에이전트를 만들다가 “작은 모델은 어디에 쓰는 거지” 싶었던 사람, 하이쿠라는 이름을 오늘 처음 들은 사람에게 맞춰 썼다. 낯선 용어는 나올 때마다 한 줄로 풀었다.

본 자료는 앤스로픽 발표문, 클로드 플랫폼 문서의 하이쿠 5.5 개요·마이그레이션 가이드·가격표·구독자 API 크레딧 문서, 오픈AI 개발자 문서의 GPT-6 루나 페이지, 그리고 Hacker News 댓글이다. 아래 점수는 전부 앤스로픽이 직접 잰 값이고, 이 사이트가 모델을 호출해 다시 잰 값은 없다.

하이쿠는 무엇이고, 왜 싼 모델을 따로 두나

클로드는 크기와 값이 다른 모델 여러 개로 나뉘어 있다. 문서의 모델 비교표에는 큰 쪽부터 페이블, 오퍼스, 소네트, 그리고 가장 작고 빠른 하이쿠가 오른다. 큰 모델은 어려운 문제를 오래 생각해서 풀고, 작은 모델은 쉬운 일을 아주 싸게 아주 많이 처리한다. 식당으로 치면 주방장과 보조 요리사 같은 관계다.

앤스로픽이 하이쿠 5.5에 붙인 용도는 “대량으로 돌리는, 값에 민감한 일”이다. 발표문이 직접 든 예는 요약, 대화 압축(compaction, 길어진 대화를 짧게 줄여 이어 가는 일), 데이터베이스 질의, 분류다. 오퍼스 5.5나 소네트 5.5가 코딩 작업을 지휘할 때 옆에서 잔일을 맡는 서브에이전트로도 잘 어울린다고 했다. 속도가 가장 빠른 모델이라 실시간 고객 상담이나 브라우저를 대신 조작하는 일에도 맞는다는 설명이다. 다만 각주에 “각 모델의 표준 속도 기준이고, 오퍼스의 패스트 모드보다는 느리다”는 단서가 붙어 있다.

모델 입력 / 출력 (100만 토큰당) 속도 기본 effort
페이블 5.1 10달러 / 50달러 느림 high
오퍼스 5.5 4달러 / 20달러 보통 medium
소네트 5.5 2달러 / 10달러 빠름 high
하이쿠 5.5 0.10달러부터 / 0.50달러부터 가장 빠름 medium

위 표는 클로드 플랫폼 문서의 모델 비교표다. 하이쿠 5.5 입력값이 소네트 5.5의 20분의 1, 오퍼스 5.5의 40분의 1, 페이블 5.1의 100분의 1이다. 출력도 똑같이 20배, 40배, 100배 차이가 난다. 컨텍스트 창(한 번에 읽을 수 있는 양)은 네 모델 모두 100만 토큰, 최대 출력은 12만 8천 토큰이다.

1달러가 0.10달러가 되는 계산

발표문의 가격표를 하이쿠 4.5, 소네트 5.5와 나란히 놓으면 이렇다. 단위는 100만 토큰당 달러이고, 하이쿠 5.5의 두 값은 “프롬프트가 10만 토큰 이하일 때 / 넘을 때”다.

항목 하이쿠 5.5 (10만 이하 / 초과) 하이쿠 4.5 소네트 5.5
입력 0.10 / 0.50 1.00 2.00
출력 0.50 / 2.50 5.00 10.00
캐시 읽기 0.01 / 0.05 0.10 0.10 (오늘 0.20에서 인하)
캐시 쓰기 0.125 / 0.625 1.25 2.50

캐시는 같은 앞부분을 매번 다시 보내는 대신 한 번 저장해 두고 싼값에 다시 읽는 기능이다. 긴 지시문을 매 요청마다 붙이는 챗봇이라면 청구서에서 가장 큰 항목이 되기도 한다. 하이쿠 5.5는 캐시 읽기도 하이쿠 4.5의 10분의 1이다.

발표문이 내건 숫자는 “평균 약 75% 저렴”이다. 이 숫자의 근거는 각주에 있다. 하이쿠 5.5는 하이쿠 4.5보다 10만 토큰 이하 요청에서 90%, 초과 요청에서 50% 싸고, 하이쿠 4.5 요청의 90%가 10만 토큰 이하였다. 여기에 새 토크나이저(글을 토큰으로 자르는 방식) 때문에 같은 일에 토큰이 조금 더 쓰이는 효과까지 반영해서 75%가 나왔다는 설명이다.

내 서비스에 대입해 보자. 아래는 이 글이 가정을 둔 계산 예시이고, 앤스로픽이 발표한 값이 아니다.

이 가정에서는 약 87% 줄어든다. 발표문의 평균 75%보다 큰 이유는 예시가 전부 10만 토큰 이하 요청이기 때문이다. 긴 문서를 넣는 서비스는 그만큼 덜 줄어든다.

10만 토큰 선: 넘으면 단가가 5배가 된다

가장 눈에 걸리는 부분은 “프롬프트가 10만 토큰을 넘으면 높은 단가”라는 구조다. 가격 문서는 소네트·오퍼스를 포함한 클로드 4.6 이후 모델이 100만 토큰 컨텍스트 창을 표준 단가 그대로 준다고 적고, 하이쿠 5.5만 예외라고 못박았다. 하이쿠 5.5도 컨텍스트 창은 100만 토큰이지만, 10만 토큰을 넘는 프롬프트는 입력 0.50달러·출력 2.50달러를 낸다. 10만 이하 단가의 정확히 5배다.

Hacker News에서 이 점이 가장 먼저 지적됐다. 한 댓글은 “10만 토큰은 터무니없이 낮은 기준선이고 소네트나 오퍼스에는 없는 제한이라, 에이전트로 뭘 하면 금방 넘는다”고 썼다. 동시에 “일반적인 생성이나 분류기 용도라면 좋은 값”이라고도 했다. 앤스로픽이 발표문에서 “요청의 약 90%가 10만 토큰 이하”라고 근거를 댄 것과 같은 이야기를 반대편에서 한 셈이다.

다른 댓글은 구조 자체가 이상한 게 아니라는 반론을 냈다. 긴 입력을 처리하는 계산량은 입력 길이에 비례해서 늘지 않으니, 모든 길이에 같은 단가를 매기는 쪽이 오히려 이상하다는 주장이다. 이 논쟁에서 어느 쪽이 맞는지는 이 글이 판정할 수 없다. 개발자에게 남는 실무 결론은 하나다. 내 요청이 10만 토큰을 넘는 일이 얼마나 자주 있는지 먼저 세어 봐야 한다.

참고로 배치 API(결과를 바로 받지 않고 모아서 처리하는 방식)는 입력·출력 모두 50% 할인이다. 하이쿠 5.5의 배치 값은 10만 이하 기준 입력 0.05달러, 출력 0.25달러다.

같은 값에 나온 오픈AI의 작은 모델

비교 대상이 하나 있다. 하이쿠 5.5의 10만 이하 단가는 오픈AI의 작은 모델 GPT-6 루나와 똑같다. 오픈AI 개발자 문서의 루나 페이지에는 입력 0.10달러, 출력 0.50달러, 캐시 읽기 0.01달러, 캐시 쓰기 0.125달러로 적혀 있다. 하이쿠 5.5의 10만 이하 값과 네 항목이 전부 같다.

차이는 선이 어디에 있느냐다. 오픈AI 문서에 따르면 루나는 입력이 27만 2천 토큰을 넘는 프롬프트에 “그 요청 전체”의 입력·캐시 단가를 2배, 출력 단가를 1.5배로 매긴다. 하이쿠 5.5는 10만 토큰에서 5배다. 앤스로픽 문서의 표현은 “10만 토큰을 넘는 프롬프트는 더 높은 단가”여서, 넘은 부분에만 붙는지 요청 전체에 붙는지는 문서에 문장으로 적혀 있지 않다. 오픈AI는 “전체 요청”이라고 분명히 적었다. 이 글은 앤스로픽 쪽을 “프롬프트 길이에 따라 단가가 둘로 갈린다”까지만 확인된 사실로 취급한다.

컨텍스트 창은 루나가 105만 토큰으로 하이쿠 5.5의 100만 토큰과 비슷하고, 최대 출력은 둘 다 12만 8천 토큰이다. 한 개발자는 댓글에서 “하이쿠 4.5는 GPT-6 루나의 10배 값이라 불만이었는데 이제 같아졌다”고 적었다.

토큰이 30% 더 나온다: 값이 내린 만큼 깎이는 부분

싼 단가에만 눈이 가면 놓치기 쉬운 항목이 새 토크나이저다. 마이그레이션 가이드는 하이쿠 5.5가 클로드 4.7 이후 모델과 같은 새 토크나이저를 쓰고, 같은 입력 글이 하이쿠 4.5보다 약 30% 더 많은 토큰으로 센다고 적었다. 정확한 증가율은 내용에 따라 다르다.

이 차이가 세 군데에서 문제를 낸다. 하나, 청구서의 usage 필드와 토큰 세기 결과가 같은 글에서 더 큰 숫자로 나온다. 둘, 하이쿠 4.5에 맞춰 둔 max_tokens(출력 상한)가 같은 길이의 답변을 중간에서 자를 수 있다. 셋, 하이쿠 4.5의 토큰 수로 뽑아 둔 비용 추정은 다시 계산해야 한다. 가이드의 지시는 단순하다. 옮기기 전에 model을 claude-haiku-5-5로 둔 채 내 프롬프트의 토큰을 다시 세라는 것이다.

위의 계산 예시에서 단가가 90% 내려가도 청구액이 87% 내려간 이유가 이것이다. 토큰이 30% 늘면 0.10 × 1.3 = 0.13이 되므로, 입력 단가를 90% 내린 효과는 실제로 87% 안팎에서 멈춘다.

점수표: 하이쿠 4.5와는 격이 다르고, 소네트 5.5와는 거리가 있다

아래는 발표문의 벤치마크 표를 그대로 옮긴 것이다. 가운데 두 열이 이전 하이쿠와 오픈AI의 작은 모델이고, 맨 오른쪽 소네트 5.5는 “참고용”으로 붙은 열이다. 표에는 하이쿠 5.5를 어떤 effort로 쟀는지가 적혀 있지 않고, 소네트 5.5의 FrontierCode 값에만 xhigh 표기가 붙어 있다.

시험 하이쿠 5.5 하이쿠 4.5 GPT-6 루나 소네트 5.5
GDPval-AA v2.1 (직업 업무, Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (지식 업무) 1578 614 1336 1824
OSWorld 2.1 (컴퓨터 조작, 오프라인 부분집합) 72.4% 15.7% 48.9% 83.9%
인류의 마지막 시험 (도구 없음) 45.9% 10.2% 표기 없음 56.9%
인류의 마지막 시험 (도구 있음) 57.4% 18.7% 표기 없음 64.5%
Terminal-Bench 4.0 (터미널 코딩) 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 Main (코딩) 46.4% 표기 없음 42.4% 52.1% (xhigh)
Chartography (차트 읽기, 도구 없음) 46.4% 6.4% 29.1% 61.6%

시험 이름이 낯설 테니 발표문이 붙인 설명을 옮긴다. OSWorld는 에이전트가 실제 컴퓨터를 조작해 여러 단계짜리 일을 끝내는지를 잰다. GDPval-AA는 44개 직업의 실제 업무로 에이전트를 평가한다. 인류의 마지막 시험은 전문가 수준의 학술 지식과 추론을 묻는다. Terminal-Bench는 명령어 창(터미널)에서 복잡한 여러 단계 전문 작업을 끝내는지를 본다.

읽는 법은 세 가지다. 첫째, 이전 하이쿠와의 격차가 매우 크다. 컴퓨터 조작은 15.7%에서 72.4%로, 터미널 코딩은 0.0%에서 39.2%로 올랐다. 하이쿠 4.5는 터미널 코딩 시험에서 한 문제도 통과하지 못한 것으로 표에 나온다.

둘째, 오픈AI의 작은 모델과는 표에 오른 모든 칸에서 앞선다. 다만 이것도 앤스로픽이 고른 시험지 위의 이야기다. 오픈AI가 같은 표를 만들었다면 칸이 달라졌을 것이다.

셋째, 소네트 5.5와는 거리가 있고, 그 거리는 코딩에서 가장 크다. Terminal-Bench 4.0에서 39.2% 대 70.6%로 차이가 31.4점이다. OSWorld는 72.4% 대 83.9%로 11.5점 차이라 상대적으로 좁다. 앤스로픽은 이 차이를 숨기지 않았다. 발표문은 소네트 5.5와 오퍼스 5.5가 “터미널 벤치 같은 복잡한 에이전트 코딩 작업”에서 더 나은 선택이고, 하이쿠 5.5는 요약·압축·서브에이전트처럼 범위가 좁은 일에 맞는다고 적었다. 이전에는 값 때문에 엄두를 못 냈을 일들이 하이쿠 5.5의 자리라는 설명이다.

effort 다이얼: 같은 모델로 싸게도 비싸게도

하이쿠 5.5는 하이쿠 계열 처음으로 effort(노력 수준) 설정을 받았다. 낮음·중간·높음·xhigh·최대(max) 다섯 단계이고 기본값은 중간이다. 낮게 두면 모델이 덜 생각해서 싸고 빠르고, 높게 두면 오래 생각해서 정확하지만 비싸다. 발표문의 차트는 OSWorld, GDPval-AA, 인류의 마지막 시험 세 시험에서 단계별 점수와 건당 비용을 그려 놓았다. 차트라 정확한 숫자는 글로 옮기지 않는다.

숫자로 감을 잡을 수 있는 사례가 Hacker News 댓글에 있었다. 사이먼 윌리슨이 같은 요청(자전거 탄 펠리컨 그림을 SVG로 그리기)을 effort별로 돌렸다. 가장 낮은 단계는 7초에 0.0936센트, 최대 단계는 5분 9초에 3.3826센트가 들었다. 비용 차이가 약 36배, 시간 차이가 약 44배다. 이건 벤치마크가 아니라 한 사람이 한 가지 요청으로 해 본 시험이니 일반화하면 안 된다. 다만 effort 하나로 같은 모델의 비용이 수십 배 움직일 수 있다는 점은 분명히 보여 준다. 그림 자체는 낮은 단계에서 자전거 프레임이 틀렸고 중간 이상은 맞았다고 한다.

하이쿠 4.5로 “생각 없이” 돌리던 일이라면 effort를 낮게 두는 것이 가이드의 안내다. 낮은 단계에서는 모델이 아예 생각을 건너뛸 수도 있다.

쓰던 코드를 옮길 때 깨지는 것

모델 이름만 바꾸면 되는 줄 알고 옮기면 요청이 거절된다. 마이그레이션 가이드가 “깨지는 변경”으로 꼽은 것을 정리했다.

바뀐 요청의 모양은 문서의 예시 그대로 이렇다.

{
  "model": "claude-haiku-5-5",
  "max_tokens": 16000,
  "thinking": { "type": "adaptive" },
  "output_config": { "effort": "medium" },
  "messages": [{ "role": "user", "content": "..." }]
}

생각 토큰도 max_tokens에 포함되므로, 하이쿠 4.5에서 작게 잡았던 값을 그대로 두면 생각 블록만 나오고 stop_reason: "max_tokens"로 끝날 수 있다. 문서는 이럴 때 max_tokens를 올리거나 effort를 낮추라고 안내한다. 이 글은 위 요청을 실제로 보내 본 것이 아니라 문서 예시를 옮긴 것이다.

같은 날 나온 두 가지: 소네트 5.5 캐시 반값, 구독자 월 API 크레딧

하이쿠 5.5와 함께 발표된 값 조정이 둘 있다. 하나는 소네트 5.5의 캐시 읽기 값 반값 인하다. 100만 토큰당 0.20달러에서 0.10달러가 됐고, 앤스로픽은 이것만으로 대부분의 에이전트 작업에서 소네트 5.5 비용이 약 20% 줄어든다고 설명했다. 에이전트는 같은 맥락을 반복해서 읽는 일이 많아서 캐시 읽기가 토큰 소비의 큰 몫을 차지하기 때문이다. 이 글이 이전에 다룬 페이블 5.1의 캐시 값 인하와 같은 계열의 조정이다.

다른 하나는 Max·Team 구독자에게 주는 월 API 크레딧이다. 발표문은 “이번 주에 제공을 시작한다”고 했다. 문서의 금액은 아래와 같다.

플랜 월 크레딧
Max 5x 100달러
Max 20x 200달러
Team 일반 좌석 좌석당 20달러 (팀 합산, 상한 500달러)
Team 프리미엄 좌석 좌석당 100달러 (팀 합산, 상한 500달러)

문서에서 놓치기 쉬운 조건이 몇 개 있다. 크레딧은 클로드 API·매니지드 에이전트·에이전트 SDK·플레이그라운드에만 쓰이고, 클로드 코드와 앱의 추가 사용분에는 쓰이지 않는다. 쓰려면 클로드 콘솔 조직을 구독에 연결해야 하고, 신규 구독자는 7일 뒤부터 받을 수 있다. 크레딧은 결제 주기가 끝나면 사라져 이월되지 않으며, 프로·무료·엔터프라이즈 플랜은 대상이 아니다. 아마존 베드록이나 구글 클라우드에서는 쓸 수 없다.

하이쿠 5.5의 값과 합치면 계산이 재미있어진다. 이 글의 위 계산 예시(월 1만 건, 7.15달러)를 기준으로 하면 Max 5x의 월 100달러는 그런 규모의 서비스 10개 이상을 돌릴 금액이다. 이건 이 글의 산수이고, 앤스로픽이 그렇게 홍보한 것은 아니다. Hacker News에서는 이 크레딧이 “내 구독 안에서 다른 도구와 서비스를 돌릴 수 있게 해 준다”며 반기는 댓글이 있었고, 다른 한쪽에서는 “사용자에게 불리한 다른 변경을 누그러뜨리려는 것 아니냐”는 의심도 올라왔다. 둘 다 댓글 쓴 사람의 해석이다.

써 본 사람들은 이렇게 말했다

발표문에는 고객사 여섯 곳의 인용이 붙어 있다. 전부 앤스로픽이 고른 인용이라는 점을 감안하고 읽는다.

Hacker News(약 590점, 댓글 280여 개)의 반응은 더 갈렸다. 한 사용자는 이미지를 HTML로 옮기는 복잡한 화면 작업을 시켰더니 하이쿠 5.5가 “자기 일이 아니라고 판단해” 곧바로 오퍼스 5.5에 넘겼고, 결과물은 오퍼스 쪽이 나았다고 썼다. 속도는 매우 빠르니 작은 서브에이전트 일에 맞는다는 평가였다.

반대 경험도 있다. 회사에서 지연에 민감한 단순 작업에 하이쿠 4.5를 쓰던 한 사용자는 하이쿠 5.5를 시험해 보니 “지금까지 결과는 형편없고, 프롬프트 내용이 답에 새어 나오기까지 하며, 더 느리다”고 적었다. 한 명의 후기이고 재현 여부는 확인되지 않았다. 그래서 이 글의 결론은 점수표도 댓글도 아닌 내 작업으로 직접 재 보라는 것이다.

“하이쿠를 어디에 쓰느냐”는 질문에 달린 답도 참고가 된다. 어떤 개발자는 버그 보고서 여러 개가 서로 관련 있는지 1차로 묶는 용도로만 쓰고, 파고드는 조사는 소네트에 맡긴다고 했다. 앤스로픽이 말한 “범위가 좁은 일”의 실사용 예다.

아직 비어 있는 칸: 한국어, 시험 조건, 시스템 카드

몇 가지는 문서 어디에도 숫자로 나오지 않는다.

하이쿠 5.5로 옮길 일과 남겨 둘 일

하이쿠 5.5로 옮길 만한 일과 아닌 일을 나눠 보면 이렇다.

이런 일이면 하이쿠 5.5 소네트·오퍼스
메일·문의·버그 분류 맞음 과함
긴 대화 압축, 요약 맞음 과함
큰 모델이 지휘하는 서브에이전트(검색·추출) 맞음 지휘 쪽에 사용
실시간 상담, 브라우저 조작 속도 면에서 맞음, 정확도는 직접 확인 정확도가 중요하면
여러 파일을 고치는 코딩 에이전트 앤스로픽이 권하지 않음 맞음
요청이 대부분 10만 토큰을 넘는 일 단가가 5배, 이득이 줄어듦 표준 단가로 100만 토큰까지

오늘 해볼 일은 네 가지로 줄일 수 있다.

  1. 지금 코드에서 작은 모델이나 하이쿠 4.5를 부르는 곳을 모두 찾아 목록으로 만든다. 그 목록이 옮길 후보다.
  2. 후보마다 실제 프롬프트 길이를 확인한다. 10만 토큰을 넘는 요청이 몇 %인지 세어 보면 단가 계산이 끝난다.
  3. 하이쿠 5.5 기준으로 토큰을 다시 세고(model을 claude-haiku-5-5로), max_tokens를 넉넉히 올린다. 위 예시 JSON처럼 thinking과 effort를 바꾸고 temperature는 지운다.
  4. 실제 요청 100~200건을 골라 effort 낮음과 중간을 나란히 돌려 본다. 정확도가 같다면 낮은 쪽이 싸고, 다르다면 그 차이가 값어치가 있는지 숫자로 판단한다.

Max나 Team 구독자라면 설정의 결제 화면에서 콘솔 조직을 연결해 두자. 크레딧은 이월되지 않으니 연결이 늦을수록 그 달 몫이 줄어든다. 한 줄로 줄이면 이렇다. 싸진 건 사실이고 코딩이 약한 것도 사실이다. 내 요청 중 어느 쪽에 가까운지는 위 네 단계를 하루 돌려 보면 숫자로 나온다.