클로드 오퍼스 5.5, 20% 싸지고 1위 됐다

클로드로 코드를 돌리거나 에이전트를 운영하고 있다면, 이번 주는 요금 계산기를 다시 열어야 한다.
앤스로픽이 2026년 9월 22일 낸 클로드 오퍼스 5.5는 입력 토큰 값을 100만 개당 5달러에서 4달러로, 출력 토큰 값을 25달러에서 20달러로 낮췄다. 둘 다 20%씩 내려간 것이다.
그런데 성능은 전부 올랐다. 벤치마크 5종 모두 전작보다 점수가 높고, 속도는 30% 넘게 빨라졌다. 신형 모델이 나오면 값이 오르거나 최소한 그대로인 게 보통인데, 이번엔 반대로 갔다.
이 글은 클로드 API나 클로드 코드로 실제 서비스·업무를 돌리는 개발자, 그리고 매달 나가는 AI 비용을 관리해야 하는 사람을 위한 것이다. 지난번 클로드 페이블 5.1의 캐시 가격 개편을 다룰 때처럼, 이번에도 앤스로픽 공식 발표문과 공식 모델 비교표를 직접 대조해 숫자를 확인했다.
값은 내려갔는데 순위는 1위로 올라갔다
이번 발표에서 가장 눈에 띄는 대목은 “싸졌다”가 아니라 “싸졌는데 더 세졌다”는 쪽이다.
AI 모델 성능을 독립적으로 측정하는 Artificial Analysis 기준으로, 오퍼스 5.5는 지능 지수(Intelligence Index) 58점을 받았다. 이 지수를 매기는 212개 모델 전체 중 1위다. 참고로 전체 모델의 중간값은 25점이니, 1위와 중간값 사이 격차가 두 배가 넘는다.
가격 대비 성능으로 보면 살짝 결이 다르다. 같은 사이트의 “비용 효율성” 순위에서는 212개 모델 중 93위다. 여전히 전체 모델 중간값(입력 100만 토큰당 2달러, 출력 10달러)보다는 비싸다는 뜻이다. 즉 **“제일 싸다”는 아니고 “직전 모델보다 싸졌다” + “전체 1등”**이 정확한 그림이다. 절대적으로 저렴한 모델을 찾는다면 오퍼스 라인이 아니라 소네트나 하이쿠 쪽을 봐야 한다.
정리하면, 이번 개편은 “누구나 갖고 싶어 하는 가장 싼 모델”을 노린 게 아니라 “가장 똑똑한 모델을 예전보다 더 감당할 만한 값에”로 방향을 잡은 것으로 읽힌다. 오퍼스 라인은 원래 프런티어 성능을 위해 값을 더 받던 자리였는데, 이번엔 그 자리를 지키면서 값만 내렸다는 게 핵심이다.
벤치마크 5개, 전부 올랐다
앤스로픽이 공식 발표문에서 오퍼스 5(직전 모델) 대비 수치로 제시한 벤치마크는 다섯 가지다.
| 벤치마크 | 무엇을 재는가 | 오퍼스 5 | 오퍼스 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 터미널에서 실제 작업을 끝까지 해내는 능력 | 52.3% | 66.4% |
| FrontierCode v1.1 | 실전 수준 코딩 문제 해결 | 48.0% | 54.4% |
| CursorBench 4.0 | 코드 에디터 안에서의 코딩 능력 | 46.6% | 57.8% |
| GDPval-AA v2.1 | 실제 업무(지식노동) 완성도, Elo 방식 | 1708 | 1846 |
| OSWorld 2.0 | 컴퓨터 화면을 직접 조작해 과제 완료 | 74.0% | 81.8% |
각 벤치마크가 재는 것을 하나씩 풀어 보면 이렇다.
Terminal-Bench는 사람이 쓰는 진짜 터미널 작업(파일 찾기, 빌드 스크립트 고치기, 로그 뒤지기 같은 것)을 모델이 혼자 끝까지 해내는지를 본다. 중간에 막히지 않고 “완료”까지 가야 점수가 나오는 구조라, 점수가 오른다는 건 곧 사람이 중간에 끼어들 일이 줄어든다는 뜻이다. 이 항목이 52.3%에서 66.4%로 14%포인트 넘게 뛴 게 이번 발표에서 가장 큰 폭의 개선이다. 코딩 에이전트를 터미널에 붙여 쓰는 워크플로일수록 체감이 클 수 있는 구간이다.
FrontierCode와 CursorBench는 둘 다 코딩 능력을 재지만 상황이 다르다. FrontierCode는 실전 수준의 어려운 코딩 문제를 통째로 푸는 능력이고, CursorBench는 코드 에디터 환경 안에서 기존 코드를 수정·보완하는 능력이다. 둘 다 10%포인트 안팎으로 올랐다 — “새 코드를 짜는 것”과 “기존 코드를 고치는 것” 양쪽 다 좋아졌다는 뜻이다.
GDPval-AA는 조금 특이한 채점 방식을 쓴다. 점수를 바로 매기지 않고, 모델 두 개의 결과물을 맞대결시켜 어느 쪽이 나은지를 반복 비교한 뒤 체스에서 쓰는 것과 같은 Elo 점수로 환산한다. 1846 대 1708이면 격차가 138점인데, Elo 체계에서 이 정도 차이는 맞대결에서 오퍼스 5.5가 오퍼스 5를 상당히 자주 이긴다는 뜻이다. 코딩이 아니라 리포트 작성·자료 정리 같은 일반 지식노동 과제를 기준으로 잰 점수라, “코드는 잘 짜는데 문서 작업은 어떨까” 하는 궁금증에 답이 되는 지표다.
OSWorld 2.0은 코드를 짜는 능력이 아니라 “마우스·키보드로 화면 속 프로그램을 실제로 조작하는” 능력을 잰다 — 브라우저를 열고, 클릭하고, 파일을 저장하는 식의 작업이다. 74%에서 81.8%로 올랐다. 에이전트에게 컴퓨터를 통째로 맡기는 용도(예: 지난번 다룬 메타 뮤즈 같은 구조)를 생각한다면 챙겨볼 지표다.
“30% 빠르다”는 게 실제로 뭘 의미하나
앤스로픽은 공식 발표문에서 “오퍼스 5보다 30% 넘게 빠르게 출력을 생성한다”고 밝혔다. 정확한 초당 토큰 수치는 발표문에 없다.
이게 왜 중요하냐면, 출력 속도는 곧 사람이 답을 기다리는 시간이기 때문이다. 코드 리뷰를 부탁하고 5초 기다리던 게 3.5초로 줄어드는 정도의 체감이다. 긴 리포트나 긴 코드 diff처럼 출력량이 많을수록 이 차이는 절대 시간으로 더 크게 벌어진다.
에이전트를 여러 단계로 연쇄시켜 쓰는 구조(하나가 끝나야 다음이 시작하는 방식)라면, 단계마다 30% 빨라진 게 누적돼 전체 완료 시간이 체감상 더 크게 줄어든다.
캐시 가격은 반의반 수준으로 내려갔다
캐시는 “AI에게 매번 같은 배경 설명(시스템 프롬프트, 긴 문서, 코드베이스 등)을 반복해서 읽히는 대신, 한 번 읽힌 내용을 잠깐 저장해 뒀다가 재사용하는 기능”이다. 같은 내용을 다시 보낼 때 처음부터 다시 읽는 값을 안 내도 된다.
오퍼스 5.5의 캐시 읽기 가격은 100만 토큰당 0.20달러다. 오퍼스 5는 0.50달러였으니 60% 낮아졌다. 캐시 쓰기(처음 저장할 때 드는 값)도 6.25달러에서 5달러로 내려갔다.
코딩 에이전트가 같은 코드베이스를 붙잡고 반복 작업을 할 때, 또는 긴 문서를 배경으로 깔고 여러 질문을 이어 던질 때 이 캐시 읽기 값이 실제 청구서에서 차지하는 비중이 크다. 지난번 클라우드플레어 AI 게이트웨이로 LLM 비용을 통제한 사례에서 다뤘듯, 캐시 적중률을 얼마나 끌어올리느냐가 실제 청구 금액을 가르는 변수인데 이번 가격 인하로 그 변수의 가치 자체가 더 커졌다.
앤스로픽은 이번 인하를 합쳐 “전형적인 작업량 기준으로 오퍼스 5보다 40% 저렴하다”고 밝혔다. 입력·출력 단가만 보면 20%씩 내려간 것으로 보이지만, 캐시를 많이 쓰는 실제 사용 패턴까지 합치면 체감 절감폭이 더 크다는 뜻이다.
숫자로 계산해 보면 얼마나 줄어드나
와닿는 크기로 바꿔 보자. 코드베이스 하나를 배경으로 깔아 두고(가정: 시스템 프롬프트 + 코드 10만 토큰), 하루에 50번 질문을 던지는 코딩 에이전트를 쓴다고 하면:
- 오퍼스 5 기준: 캐시 읽기만 따져도 10만 토큰 × 50회 = 500만 토큰. 100만 토큰당 0.50달러이니 하루 2.50달러, 한 달(30일)이면 75달러.
- 오퍼스 5.5 기준: 같은 500만 토큰을 100만 토큰당 0.20달러로 계산하면 하루 1달러, 한 달 30달러.
캐시 읽기 비용만 놓고 보면 한 달에 45달러, 60%가 줄어드는 셈이다. 여기에 입력·출력 단가 인하(각 20%)까지 더해지면 실제 청구서 총액의 절감폭은 이보다 더 커진다. 물론 실제 작업량·캐시 적중률에 따라 결과는 달라지니, 이 계산은 “얼마나 줄어드는 구조인지”를 보여주는 예시로 보면 된다.
클로드 라인업 전체에서 오퍼스 5.5의 자리
앤스로픽은 오퍼스 5.5를 단독으로 발표하지 않고, 공식 모델 비교표에 페이블 5.1·소네트 5·하이쿠 4.5와 나란히 올렸다. 넷을 한 표에 놓고 보면 이번 개편에서 오퍼스 5.5가 어느 자리를 노리는지가 보인다.
| 모델 | 성격 | 입력/출력(100만 토큰당) | 컨텍스트 윈도 | 기본 effort |
|---|---|---|---|---|
| 클로드 페이블 5.1 | 가장 깊은 추론·장기 에이전트 작업 | $10 / $50 | 100만 토큰 | high |
| 클로드 오퍼스 5.5 | 장기 실행 코딩·지식노동 | $4 / $20 | 100만 토큰 | medium |
| 클로드 소네트 5 | 속도와 지능의 균형 | $2 / $10 | 100만 토큰 | high |
| 클로드 하이쿠 4.5 | 프런티어급에 가까운 가장 빠른 모델 | $1 / $5 | 20만 토큰 | 미지원 |
표를 보면 오퍼스 5.5는 페이블 5.1의 절반 이하 가격대(입력 기준 40%)로 내려와, 소네트 5와 페이블 5.1 사이의 빈자리를 메우는 모양새다. 이전 세대에서 “오퍼스는 비싸서 특수한 작업에만” 쓰던 판단 기준이, 이번 가격대에서는 다시 흔들릴 만하다.
배치로 돌리면 한 번 더 깎인다
실시간 응답이 필요 없는 작업(대량 분류, 야간 배치 요약 같은 것)이라면 배치 API를 쓸 수 있다. 공식 가격 정책상 배치 API는 이번에 내려간 오퍼스 5.5 단가에서 추가로 50% 할인된다. 입력 100만 토큰당 4달러가 아니라 2달러, 출력은 20달러가 아니라 10달러가 되는 셈이다.
실시간 응답이 필요한 서비스와 백그라운드로 돌려도 되는 작업이 섞여 있다면, 후자만이라도 배치 API로 분리하는 것만으로 같은 오퍼스 5.5를 쓰면서도 청구서 총액을 더 줄일 수 있다.
“노력(effort)“이 기본값으로 medium이라는 것
오퍼스 5.5는 답을 만들 때 얼마나 깊이 생각할지를 “effort(노력)“라는 값으로 조절한다. 값을 높이면 더 오래, 더 꼼꼼히 생각하고 값을 낮추면 더 빨리 대답한다.
공식 모델 비교표 기준으로 오퍼스 5.5의 기본 effort 값은 **medium(중간)**이다. 같은 표에서 페이블 5.1과 소네트 5는 기본값이 high(높음)로 설정돼 있다. 즉 오퍼스 5.5는 API를 그냥 기본값으로 호출하면 페이블 5.1보다는 덜 신중하게, 대신 더 빠르게 답한다는 뜻이다.
까다로운 추론이 필요한 작업이라면 effort 값을 직접 high나 max로 올려서 호출해야 한다. 앤스로픽도 “오퍼스 5.5로도 기준을 못 채우면 페이블 5.1을 쓰라”고 공식 문서에서 권한다 — 둘은 대체재가 아니라 용도가 다른 모델이라는 뜻이다.
실제로 어떻게 다르게 동작하는지 예를 들면 이렇다. 간단한 버그 하나를 고쳐 달라는 요청이면 medium 상태로도 충분히 빠르게 끝난다. 반면 여러 파일에 걸친 리팩터링처럼 단계를 여럿 거쳐야 하는 작업은, effort를 올리지 않으면 모델이 중간 단계를 건너뛰거나 얕게 훑고 지나갈 위험이 있다. API를 호출할 때 effort 파라미터 하나만 바꾸면 되므로, 작업 성격에 따라 요청마다 다르게 설정해 주는 것이 기본값 그대로 쓰는 것보다 안전하다.
1M 토큰, 그리고 발표 당일 내건 1년 약속
공식 모델 비교표에 따르면 오퍼스 5.5의 컨텍스트 윈도(한 번에 넣을 수 있는 입력 총량)는 100만 토큰, 최대 출력은 12만 8천 토큰이다. 100만 토큰은 한글 기준 대략 단행본 여러 권 분량이다 — 코드베이스 전체나 긴 계약서 뭉치를 통째로 넣고 질문할 수 있는 크기다.
지식 컷오프(모델이 안정적으로 아는 정보의 마지막 시점)는 2026년 6월이다. 최근 석 달치 사건은 모델이 스스로는 모른다고 봐야 한다.
그리고 눈에 띄는 대목이 하나 더 있다. 앤스로픽은 오퍼스 5.5를 “2027년 9월 22일 이전에는 은퇴시키지 않는다”고 발표 당일 공식 문서에 못박았다. 출시일로부터 정확히 1년이다. 보통 은퇴 일정은 출시하고 한참 지나서야 나오는데, 이번엔 첫날부터 “최소 1년은 이 모델 그대로 쓸 수 있다”를 약속한 셈이다. 프로덕션에 모델을 붙여 쓰는 입장에서는 마이그레이션 일정을 미리 짤 수 있는 근거가 하나 생긴 것이다.
이 약속이 실질적인 이유는, 프로덕션에서 모델 ID를 고정해 두고 쓰는 서비스가 많기 때문이다. 은퇴 일정이 불확실하면 “언제 다음 모델로 옮겨야 하나”를 계속 신경 써야 하는데, 최소 1년이 보장되면 그 기간만큼은 마이그레이션 계획을 미뤄 둬도 된다는 확신이 생긴다. 공식 모델 비교표에는 현재 라인업(페이블 5.1·오퍼스 5.5·소네트 5·하이쿠 4.5) 전부에 이런 은퇴 최소 보장일이 나란히 적혀 있어, 이번 오퍼스 5.5만의 특별 대우가 아니라 앤스로픽이 최근 굳혀 가는 일반적인 표기 방식으로 보인다.
같은 날, 오픈AI도 신모델을 냈다
같은 날 오픈AI도 새 모델 GPT-6 Sol과 Luna를 발표했다. 해커뉴스·긱뉴스 양쪽에서 두 발표가 나란히 최상단에 오를 정도로 같은 시간대에 겹쳤다.
두 회사가 같은 주, 심지어 같은 날 플래그십 모델을 나란히 내놓은 건 우연이 아니라 경쟁 압박이 그만큼 빡빡하다는 신호로 읽힌다. 모델 하나를 준비해서 발표하기까지 걸리는 시간을 생각하면, 양쪽 다 상대방의 출시일을 미리 알고 맞춘 것이라기보다는 “먼저 내지 않으면 뒤처진다”는 압박 속에서 개발 속도 자체가 비슷하게 빨라진 결과로 보는 게 맞다. GPT-6 Sol·Luna의 구체적인 가격·성능은 아직 별도로 검증 중이라 이 글에서는 수치를 인용하지 않는다 — 확인되는 대로 별도로 다룬다.
이런 동시 발표 자체가 개발자 입장에서는 나쁘지 않은 신호다. 경쟁이 붙을수록 가격은 내려가고 벤치마크 점수는 올라가는 쪽으로 움직인다 — 이번 오퍼스 5.5의 가격 인하도 그 흐름 안에 있다고 보는 편이 자연스럽다.
지금 오퍼스 5나 5.5를 쓰고 있다면 뭘 하면 되나
기존에 오퍼스 5를 API로 호출하고 있었다면 모델 ID를 claude-opus-5-5로 바꾸는 것만으로 가격 인하 혜택을 받는다. 앤스로픽이 공개한 모델 ID는 다음과 같다.
- Claude API:
claude-opus-5-5 - Amazon Bedrock:
anthropic.claude-opus-5-5 - Google Cloud Vertex AI:
claude-opus-5-5 - Microsoft Foundry:
claude-opus-5-5
효과를 확인하려면 세 가지를 순서대로 보면 된다.
첫째, 캐시를 얼마나 쓰고 있는지 확인한다. 캐시 적중률이 높은 워크로드일수록 이번 가격 인하 체감이 크다.
둘째, effort 값을 명시적으로 설정하고 있는지 확인한다. 기본값(medium)으로 두고 쓰고 있었다면, 복잡한 작업에서는 결과 품질이 이전과 달라질 수 있다 — 필요하면 high로 올려서 비교해 본다.
셋째, 소네트 5로 처리하던 작업 중 일부를 오퍼스 5.5로 올릴 만한지 재본다. 오퍼스 라인 가격이 내려간 만큼, 예전엔 비용 때문에 소네트로 내려서 쓰던 작업이 이제는 오퍼스로도 감당할 만해졌을 수 있다.
한 가지 짚어 둘 점은, 오퍼스 5 API 호출이 자동으로 오퍼스 5.5로 바뀌지는 않는다는 것이다. 모델 ID를 코드에서 직접 claude-opus-5-5로 바꿔 줘야 새 가격과 새 성능이 적용된다. 오퍼스 5는 당장 사라지지 않고 계속 호출 가능하므로, 급하게 바꾸지 않고 먼저 테스트 환경에서 전환한 뒤 결과를 비교하고 나서 운영 환경에 반영하는 순서를 밟아도 된다.
특히 effort 기본값이 달라지는 만큼, 전환 직후에는 예전과 답변의 깊이나 길이가 달라 보일 수 있다. 실제 운영에 반영하기 전에 자주 쓰는 프롬프트 몇 개를 오퍼스 5와 5.5 양쪽에 돌려서 결과물을 나란히 비교해 보는 걸 권한다. 체감 차이는 워크로드마다 다르다. 직접 코드베이스나 업무에 걸어 두고 비교해 보는 게 발표문 숫자보다 정확하다.