Opus 4.8이나 Sonnet 5를 쓰던 중에 2026년 7월 24일 Claude Opus 5가 나왔고, 옮겨야 할지 감이 안 잡힙니다. 그냥 지나치면 같은 값(입력 $5·출력 $25 그대로)에 올라간 성능을 놓치게 됩니다.
Claude를 실무에 붙여 써온 관점에서 공식 발표를 정리했습니다. 다 읽으면 4.8에서 뭐가 달라졌는지, 실무에서 바꿔야 할 것, 옮길지 판단 기준이 정리됩니다.

1. 뭐가 달라졌나 — 같은 가격, 큰 폭의 도약
Claude Opus 5는 2026년 7월 24일 출시됐고 모델 ID는 claude-opus-5입니다. 4.8의 점진적 개선이 아니라 큰 폭의 도약(step-change)으로 나왔는데, 먼저 눈에 들어오는 건 가격이 4.8과 똑같다는 점입니다.
| 항목 | Opus 4.8 | Opus 5 |
|---|---|---|
| 입력 / 출력 (100만 토큰) | $5 / $25 | $5 / $25 (동일) |
| thinking 기본값 | off | on |
thinking 끄고 effort xhigh/max |
동작 | 400 에러 |
| 프롬프트 캐시 최소 | 1,024 토큰 | 512 토큰 |
| 컨텍스트 | 작은 변형 존재 | 1M 기본 = 최대 |
표에 없는 스펙만 덧붙이면, 최대 출력은 128k 토큰이고 컨텍스트는 별도 옵션 없이 처음부터 1M입니다. 더 빠른 응답이 필요하면 API 전용 Fast 모드($10/$50, 약 2.5배 속도)가 따로 있습니다. 나머지 동작 변화(thinking·effort)는 아래 실무 섹션에서 다룹니다.
2. 벤치마크로 본 성능
공식 벤치마크는 점수 자체보다 "차순위 모델 대비" 상대치로 공개됐습니다.
| 벤치마크 | Claude Opus 5 성적 (상대 비교) |
|---|---|
| Frontier-Bench v0.1 | 전 모델 상회, 4.8의 2배 이상을 더 낮은 태스크당 비용으로 |
| CursorBench 3.2 (max effort) | Fable 5의 0.5% 이내를 약 절반 가격에 |
| ARC-AGI 3 | 차순위 모델의 약 3배 |
| Zapier AutomationBench | 같은 비용으로 차순위의 약 1.5배 |
| OSWorld 2.0 | Fable 5 결과를 약 1/3 비용으로 상회 |
| 생명과학 (vs 4.8) | 유기화학 +10.2%p, 단백질 +7.7%p |
Anthropic은 이 성능을 "Fable 5급 프런티어 지능을 절반 가격에"로 요약합니다. 점수보다 실무에서 체감되는 건 토큰 효율입니다. 법률 에이전트 작업을 max reasoning으로 돌리면 4.8과 비슷한 성능을 내면서 토큰을 약 26% 덜 씁니다. 트레이딩 벤치마크에서는 추론 토큰이 약 1/7 수준까지 내려갔습니다. 가격이 그대로인데 토큰까지 덜 쓴다는 건, 실제 청구 비용은 오히려 내려간다는 뜻입니다.
3. 실무에서 바꿔야 할 것
스펙 표보다 이 섹션이 먼저입니다. Claude Opus 5로 넘어가면서 프롬프트와 설정을 이렇게 손봅니다.
- thinking이 기본 on입니다. 4.8은 off였습니다.
max_tokens는 thinking과 응답을 합산해서 잡히니, 응답이 잘리지 않게 상한을 다시 계산해야 합니다. - 모델이 자기 검증을 알아서 합니다. 그래서 이전 모델용으로 넣던 "검증 단계를 추가해라 / 서브에이전트로 한 번 더 검증해라" 류 지시는 과검증을 유발합니다. 이런 지시는 빼는 게 낫습니다. Claude Code 서브에이전트 글의 검증 프롬프트를 그대로 쓰던 분이라면 특히 확인하세요.
- 응답이 더 길어지고, 진행 상황 설명이나 서브에이전트 위임이 늘었습니다. 장황해지면 출력 형식을 프롬프트에서 명시해 줄이는 편이 낫습니다.
- effort가 결과에 더 크게 반영됩니다.
low부터max까지 사다리가 있고 기본은high입니다. 프롬프트 캐시 최소 단위도 512토큰으로 내려갔습니다(4.8은 1,024).
⚠️ 4.8에서 되던 게 안 되는 지점 (breaking change)
증상: thinking을 끄고 effort를 xhigh나 max로 주면 400 에러가 납니다. 4.8에서는 되던 조합입니다.
원인: Opus 5는 thinking을 끈 상태에서 가장 높은 단계의 effort를 허용하지 않습니다.
해결: thinking을 끄려면 effort를 high 이하로 낮춥니다. 가장 높은 추론이 필요하면 thinking을 켠 채로 둡니다.
[개인 체감: 발행 전 채우기]
4. 옮겨야 하나 — 판단 기준
결론부터. 가격이 그대로이고 토큰을 약 26% 덜 쓰니 실제 비용은 오히려 내려갑니다. 성능도 올랐으니 안 옮길 이유가 별로 없습니다. 사용 형태별로 할 일만 정리합니다.
- Claude Max·Pro 사용자: 따로 할 일이 없습니다. Claude Max는 기본 모델, Claude Pro는 가장 강력한 선택지로 이미 Opus 5가 들어가 있습니다.
- API 사용자: model ID를
claude-opus-4-8에서claude-opus-5로 바꾸면 됩니다. 위에서 정리한 동작 변화 두 가지(thinking 기본 on, thinking 끄기 제한)만 확인하면 큰 마이그레이션 작업은 없습니다. - 가용성: Claude.ai·Claude Code·Claude Cowork·API·Amazon Bedrock·Google Vertex·Azure Foundry에서 씁니다.
Sonnet 5와의 역할 분담은 이전 기준과 크게 다르지 않습니다. 일상적이고 비용에 민감한 작업은 Sonnet 5, 복잡한 에이전틱 작업·코딩·긴 호흡(롱 호라이즌)의 작업은 Claude Opus 5로 나눕니다. 이 분업 기준은 Claude Sonnet 5 vs Opus 4.8에서 정리한 라우팅과 이어집니다.
자주 묻는 질문
Q. Claude Max·Pro를 쓰면 자동으로 Opus 5인가요?
네. Claude Max는 기본 모델, Claude Pro는 가장 강력한 모델로 Opus 5가 들어갑니다. 별도 설정 없이 이미 쓰고 있는 셈입니다.
Q. 가격이 오르나요?
아니요. 입력 $5 / 출력 $25로 4.8과 동일합니다. 더 빠른 API 전용 Fast 모드만 $10/$50로 따로 있습니다.
Q. 기존 프롬프트를 그대로 써도 되나요?
대체로 됩니다. 다만 두 가지는 손봐야 합니다. thinking이 기본 on이라 max_tokens 상한을 다시 잡아야 하고, "검증 단계를 넣어라" 류 지시는 과검증을 유발하니 빼는 게 낫습니다.
Q. Sonnet 5랑 뭘 써야 하나요?
일상적이고 비용에 민감한 작업은 Sonnet 5, 복잡한 에이전틱·코딩·롱 호라이즌 작업은 Claude Opus 5로 나누면 됩니다.
비슷한 상황이면 위 판단 기준만으로 옮길지 결정할 수 있습니다.
기준 시점: 2026-08 · 가격·스펙은 Anthropic 공식 기준
'AI 활용법 > Claude 시리즈' 카테고리의 다른 글
| Claude Code 플러그인 만들기 — 스킬·훅·MCP를 하나로 묶어 배포하기 (0) | 2026.07.21 |
|---|---|
| MCP 서버 직접 만들기 — Claude Code에 내 도구 붙이기 (0) | 2026.07.16 |
| Claude Code에 MCP 서버 연동하기 — 노션·GitHub·Sentry 붙이는 법 (0) | 2026.07.10 |
| Claude Code Hooks 실전 — 포맷·위험 명령 차단·알림 자동화 5가지 (0) | 2026.07.09 |
| Claude Sonnet 5 vs Opus 4.8 — 기본 모델 바뀌었는데 Opus 계속 써도 되나 (0) | 2026.07.07 |
IT 기술과 개발 내용을 포스팅하는 블로그
포스팅이 좋았다면 "좋아요❤️" 또는 "구독👍🏻" 해주세요!