클로드 오퍼스 5 vs 4.8 vs 페이블 5 가격·성능 비교
클로드 오퍼스 5(Claude Opus 5)는 오퍼스 4.8과 토큰 단가가 완전히 같습니다 — 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러. 값은 그대로인데 성능만 올라간 셈이라, 4.8을 쓰고 있다면 갈아탈 이유가 분명합니다. 반면 페이블 5(Fable 5)는 정확히 두 배인 10달러/50달러라서, 정말 어려운 작업이 아니면 비용 대비 이득이 적습니다. 이 글은 2026년 7월 29일 기준 공식 문서에서 확인한 세 모델의 가격표·벤치마크·갈아탈 때 깨지는 지점을 정리합니다.
1. 세 모델 한눈에 비교
앤트로픽 공식 모델 개요 문서 기준입니다. 오퍼스 5는 2026년 7월 24일, 페이블 5는 6월 9일, 오퍼스 4.8은 5월 28일에 나왔습니다.
| 항목 | 오퍼스 5 | 오퍼스 4.8 | 페이블 5 |
|---|---|---|---|
| API 모델 ID | claude-opus-5 |
claude-opus-4-8 |
claude-fable-5 |
| 입력 / 출력 (100만 토큰) | $5 / $25 | $5 / $25 | $10 / $50 |
| 컨텍스트 창 | 100만 토큰 | 100만 토큰 | 100만 토큰 |
| 최대 출력 | 12.8만 토큰 | 12.8만 토큰 | 12.8만 토큰 |
| 지식 기준 시점 | 2026년 5월 | 2026년 1월 | 2026년 1월 |
| 사고(thinking) | 기본 켜짐 · 끌 수 있음(조건부) | 기본 꺼짐 · 켜려면 명시 | 항상 켜짐 · 못 끔 |
| 상대적 응답 속도 | 보통 | 보통 | 느림 |
모델 계열 전체(오퍼스·소넷·하이쿠)를 어떤 기준으로 나눠 쓰는지는 claude 모델 비교 opus sonnet haiku 실무 선택 가이드에 정리해 두었습니다. 이 글은 그중 오퍼스·페이블 최상위 라인만 좁혀 봅니다.
2. 비용 — 실제로 얼마나 차이 나나
단가만 보면 "페이블이 두 배"로 끝이지만, 실무 비용은 배치 · 프롬프트 캐시 · 패스트 모드 세 가지에서 더 크게 갈립니다.
2-1. 기본 · 배치 · 캐시 단가
| 구분 (100만 토큰당) | 오퍼스 5 · 4.8 | 페이블 5 |
|---|---|---|
| 기본 입력 | $5 | $10 |
| 기본 출력 | $25 | $50 |
| 캐시 쓰기 (5분) | $6.25 | $12.50 |
| 캐시 쓰기 (1시간) | $10 | $20 |
| 캐시 읽기(적중) | $0.50 | $1 |
| 배치 API 입력 / 출력 | $2.50 / $12.50 | $5 / $25 |
| 패스트 모드 입력 / 출력 | $10 / $50 | 해당 없음 |
캐시 적중 단가가 기본 입력의 10분의 1이라, 같은 시스템 프롬프트를 반복해 보내는 서비스라면 캐시 적용 여부가 모델 선택보다 비용에 더 크게 작용합니다. 배치 API는 입력·출력 모두 50% 할인이고, 급하지 않은 대량 처리에 그대로 먹힙니다.
2-2. 한 달 예시로 계산해 보면
한 달에 입력 1,000만 토큰 + 출력 200만 토큰을 쓰는 서비스를 가정하고, 위 단가를 그대로 곱해 보겠습니다.
| 조건 | 오퍼스 5 · 4.8 | 페이블 5 |
|---|---|---|
| 그냥 호출 | $50 + $50 = $100 | $100 + $100 = $200 |
| 배치 API | $25 + $25 = $50 | $50 + $50 = $100 |
| 입력의 80%가 캐시 적중 | $10 + $4 + $50 = $64 | $20 + $8 + $100 = $128 |
| 패스트 모드 | $100 + $100 = $200 | 해당 없음 |
정리하면 패스트 모드를 켠 오퍼스 5가 그냥 쓴 페이블 5와 같은 값입니다. 패스트 모드는 같은 모델을 최대 2.5배 빠른 출력 속도로 돌리는 리서치 프리뷰 기능이고, 퍼스트파티 Claude API에서만 됩니다(베드록·구글 클라우드·Foundry 불가). 오퍼스 4.7에서는 아예 오류가 납니다.
2-3. 놓치기 쉬운 비용 세 가지
- 토크나이저가 바뀌어 토큰 수가 늘었다. 오퍼스 4.7 이후 모델(4.7·4.8·오퍼스 5·페이블 5)은 새 토크나이저를 쓰는데, 같은 글이 약 30% 더 많은 토큰으로 잡힙니다. 오퍼스 4.6 이하에서 옮겨 온다면 단가는 그대로여도 청구액은 오릅니다.
count_tokens로 새 모델 기준을 다시 재는 게 안전합니다. - 캐시 최소 길이가 내려갔다. 프롬프트 캐시가 걸리는 최소 길이가 오퍼스 4.8은 1,024토큰인데 오퍼스 5는 512토큰입니다. 4.8에서 "짧아서 캐시가 안 걸리던" 프롬프트가 코드 수정 없이 캐시되기 시작합니다.
- 툴 정의 시스템 프롬프트 토큰이 줄었다. 툴을 하나라도 붙이면 자동으로 들어가는 시스템 프롬프트가 오퍼스 4.7은 675토큰, 4.8은 290토큰, 오퍼스 5는 286토큰입니다(
tool_choice가auto·none일 때). 호출이 많은 에이전트라면 무시 못 할 차이입니다.
3. 벤치마크 — 공개된 수치는 어디까지인가
앤트로픽이 오퍼스 5 발표문에서 문장으로 밝힌 비교는 이렇습니다.
| 벤치마크 | 오퍼스 5의 결과 |
|---|---|
| Frontier-Bench v0.1 | 모든 모델을 앞섰고, 오퍼스 4.8 성능의 2배 이상을 작업당 더 낮은 비용으로 달성 |
| CursorBench 3.2 | 페이블 5 최고점과 0.5% 이내인데 작업당 비용은 절반 |
| ARC-AGI 3 | 차순위 모델의 약 3배 점수 |
| Zapier AutomationBench | 같은 비용에서 차순위 모델 통과율의 약 1.5배 |
| OSWorld 2.0 | 페이블 5 결과를 넘으면서 비용은 3분의 1 남짓 |
| 유기화학 / 단백질 서열 | 오퍼스 4.8 대비 +10.2%p / +7.7%p |
오퍼스 4.8 발표문에서 숫자로 나온 것은 Online-Mind2Web 84%, 그리고 Legal Agent Benchmark의 전항목 통과 기준을 처음으로 10% 넘긴 모델이라는 정도입니다. 나머지 상세 평가는 시스템 카드로 넘겨 두었습니다.
비용 관점에서 읽어야 할 문장은 "작업당 비용(cost per task)"입니다. 토큰 단가가 같아도 한 작업을 끝내는 데 쓰는 토큰이 줄면 실제 지출은 내려갑니다. Frontier-Bench에서 "성능 2배 + 작업당 비용은 더 낮음"이라고 밝힌 게 그 대목이고, 오퍼스 5로 갈아탈 실질적 근거이기도 합니다.
4. 오퍼스 4.8 → 오퍼스 5, 깨지는 두 가지
모델 ID만 바꿔도 대부분 돌아가지만, 공식 마이그레이션 가이드가 breaking change로 못박은 것이 정확히 두 개입니다.
4-1. thinking을 안 넣으면 이제 "켜진 것"이다
오퍼스 4.8에서는 thinking 필드를 생략하면 사고 없이 돌았습니다. 오퍼스 5에서는 생략 = 적응형 사고(adaptive thinking) 켜짐입니다. max_tokens는 사고 토큰과 응답 텍스트를 합쳐서 제한하므로, 4.8에서 응답 길이에 딱 맞춰 max_tokens를 잡아 뒀다면 응답이 중간에 잘릴 수 있습니다.
# 오퍼스 4.8: thinking 생략 → 사고 없음
# 오퍼스 5 : thinking 생략 → 사고 켜짐 (max_tokens를 다시 잡을 것)
response = client.messages.create(
model="claude-opus-5",
max_tokens=16000, # 사고 + 응답을 합쳐서 이 한도
messages=[{"role": "user", "content": "..."}],
)
# 예전 동작을 그대로 유지하려면 명시적으로 끈다
response = client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
messages=[{"role": "user", "content": "..."}],
)
4-2. 사고를 끄면서 effort를 xhigh·max로 올리면 400
사고를 끄는 것 자체는 되지만 effort가 high 이하일 때만 허용됩니다. thinking: {"type": "disabled"} 와 effort xhigh/max를 같이 보내면 400 오류가 납니다.
# ❌ 400 error — 사고 끄기 + xhigh 조합은 거부된다
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)
# ✅ 방법 1 — 사고를 켠 채로 effort를 올린다
client.messages.create(
model="claude-opus-5",
max_tokens=64000, # xhigh/max면 넉넉히 (64k부터 시작 권장)
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)
# ✅ 방법 2 — 사고를 끄고 effort를 high 이하로 낮춘다
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # 또는 medium, low
messages=[{"role": "user", "content": "..."}],
)
이 검사는 요청 단위라, 대화 중간에 effort만 올리는 코드가 있으면 그 요청부터 거부됩니다. effort는 오퍼스 5에서 low · medium · high · xhigh · max 다섯 단계가 전부 되고, API 기본값은 high입니다. 4.8에서 xhigh로 돌리던 작업도 일단 high부터 다시 재 보라는 게 공식 권장입니다.
5. 페이블 5는 언제 쓰나
페이블 5는 "가장 어려운 추론과 오래 도는 에이전트 작업"용으로 나온 최상위 모델입니다. 값이 두 배인 만큼 연동할 때 챙길 것도 더 많습니다.
- 사고를 끌 수 없습니다. 적응형 사고가 항상 켜져 있고
thinking: {"type": "disabled"}는 지원하지 않습니다. 깊이 조절은effort로만 합니다. - 거부 응답을 처리해야 합니다. 안전 분류기가 요청을 거절하면 오류가 아니라 HTTP 200에
stop_reason: "refusal"로 옵니다.content[0]을 무조건 읽는 코드는 여기서 깨집니다. 출력이 나오기 전에 거절되면 과금되지 않습니다. - 다른 모델로 재시도(fallback)를 붙여야 합니다. 서버 쪽
fallbacks파라미터, SDK 미들웨어, 직접 구현 세 가지가 있습니다. 재시도 시 프롬프트 캐시 비용을 두 번 물지 않도록 fallback credit이 환급해 줍니다. - 데이터 30일 보존이 필수입니다. 무보존(zero data retention) 설정으로는 쓸 수 없고, 그 상태면 요청이 전부 400으로 떨어집니다.
# 페이블 5는 content를 읽기 전에 stop_reason부터 확인한다
response = client.messages.create(
model="claude-fable-5",
max_tokens=16000,
messages=[{"role": "user", "content": "..."}],
)
if response.stop_reason == "refusal":
handle_refusal(response) # 다른 모델로 재시도
else:
print(response.content[0].text)
참고로 오퍼스 5 역시 사이버보안 관련 요청에서 거부 응답이 나올 수 있으니, 두 모델 모두 stop_reason 분기는 넣어 두는 편이 안전합니다.
6. 그래서 뭘 쓰나
| 상황 | 선택 |
|---|---|
| 지금 오퍼스 4.8을 쓰고 있다 | 오퍼스 5로 옮긴다. 단가가 같고 4장의 두 가지만 고치면 된다 |
| 복잡한 에이전트 코딩 · 사내 업무 자동화 | 오퍼스 5 — 공식 문서가 이 용도로 제일 먼저 권한다 |
| 응답 속도가 돈보다 중요하다 | 오퍼스 5 + 패스트 모드 (값은 2배, Claude API 전용) |
| 며칠씩 도는 장기 에이전트 · 최고 난도 추론 | 페이블 5 — 다만 거부 처리·30일 보존 조건을 먼저 확인 |
| 비용이 제일 중요한 대량 처리 | 소넷 5 ($3/$15, 2026년 8월 31일까지 $2/$10 도입가) 또는 오퍼스 5 + 배치 API |
자주 묻는 질문 (FAQ)
Q. 오퍼스 5가 4.8보다 비싼가요?
아닙니다. 입력 $5 / 출력 $25로 완전히 같습니다. 배치·캐시 단가도 동일합니다. 다만 오퍼스 5는 사고가 기본으로 켜지므로, 같은 요청이라도 출력 토큰이 늘어 실제 청구액은 올라갈 수 있습니다.
Q. 모델 ID에 날짜를 붙여야 하나요?
아닙니다. claude-opus-5, claude-opus-4-8, claude-fable-5 그대로 씁니다. 클로드 4.6 세대부터는 날짜 없는 ID 자체가 고정 스냅샷이라, claude-opus-5-20260724 같은 걸 지어내면 404가 납니다.
Q. 페이블 5를 아마존 베드록이나 구글 클라우드에서도 쓸 수 있나요?
됩니다. 페이블 5는 Claude API·Amazon Bedrock·Claude Platform on AWS·Google Cloud·Microsoft Foundry에서 모두 정식 제공됩니다. 다만 패스트 모드는 퍼스트파티 Claude API 전용이라 다른 플랫폼에서는 못 씁니다.
Q. Mythos 5는 뭔가요?
페이블 5와 사양·가격이 같지만 안전 분류기가 없는 모델로, Project Glasswing 승인 고객에게만 제한 제공됩니다. 자유 가입은 없습니다.
Q. 오퍼스 5에서 effort는 뭘로 시작하면 되나요?
기본값 high로 두고 자기 평가 세트로 medium·xhigh를 재 보는 순서를 권합니다. xhigh나 max로 돌릴 땐 max_tokens를 6.4만 토큰 이상으로 넉넉히 잡아야 사고 중간에 잘리지 않습니다.
마무리
정리하면 이렇습니다. 오퍼스 5는 4.8과 같은 값에 성능만 올라간 모델이라 4.8 사용자에게는 사실상 무료 업그레이드에 가깝고, 고칠 것은 사고 기본값과 effort 조합 두 가지뿐입니다. 페이블 5는 두 배 값에 거부 처리·데이터 보존 조건까지 따라오므로, 정말 최상위 성능이 필요한 작업에만 붙이는 게 맞습니다. 비용을 실제로 줄이는 지렛대는 모델 선택보다 프롬프트 캐시와 배치 API 쪽이 큽니다.
가격과 모델 목록은 자주 바뀌니, 실제 결제 전에는 앤트로픽 공식 가격 문서에서 최신 값을 한 번 더 확인하세요.
📚 참고 출처 (2026년 7월 29일 확인)
· Anthropic — Models overview
· Anthropic — Pricing
· Anthropic — Introducing Claude Opus 5
· Anthropic — Introducing Claude Opus 4.8
· Anthropic — Introducing Claude Fable 5 and Claude Mythos 5
· Anthropic — Model migration guide
COMMENTS