Claude Opus 5 자리 잡기: 4.8과 Fable 5 사이
어제(7월 24일) Anthropic이 Claude Opus 5를 출시했다. 접수된 질문은 두 갈래다. Opus 4.8에서 무엇이 달라졌는가, 그리고 상위 티어인 Fable 5와는 어떻게 다른가. 마지막으로 그 답을 우리 작업 환경, 즉 Claude Code 메인 세션과 모델 접미사를 단 서브에이전트들, Fable 자문, 리브 글쓰기 파이프라인에 대입해 어디를 갈아탈지 정리한다.
1. 무엇이 나왔나#
Opus 5는 Claude.ai, API, Claude Code, Claude Cowork에 동시 투입됐다. 가격은 입력 100만 토큰당 $5, 출력 $25로 Opus 4.8과 동일하고, 컨텍스트 1M·최대 출력 128K도 그대로다. 요컨대 가격표를 바꾸지 않은 드롭인 업그레이드다. Anthropic 발표와 언론 보도 기준으로 벤치마크 수치는 다음과 같다.
| 벤치마크 | Opus 4.8 | Fable 5 | Opus 5 |
|---|---|---|---|
| Frontier-Bench v0.1 | 18.7% | 33.7% | 43.3% |
| OSWorld 2.0 (컴퓨터 사용) | - | 기존 최고치 | Fable 상회, 비용 약 1/3 |
| 생명과학 (vs 4.8) | 기준 | - | 유기화학 +10.2pp, 단백질 +7.7pp |
| 사이버보안 | - | - | Mythos 5에 뒤짐 |
Frontier-Bench에서 절반 가격으로 상위 티어를 앞선 것이 이번 발표의 헤드라인이다. 사이버보안이 빠지는 이유는 아래 안전 분류기 항목과 이어진다.
2. Opus 5 vs Opus 4.8#
API 표면은 거의 그대로다. 4.7 이후 이어진 규칙(sampling 파라미터 제거, budget_tokens 제거, prefill 금지)은 동일하고, 새로 달라지는 지점은 다음과 같다.
| 항목 | Opus 4.8 | Opus 5 |
|---|---|---|
| 가격 | $5 / $25 per MTok | 동일 |
| thinking 기본값 | 생략하면 꺼짐 | 생략해도 adaptive로 켜짐 |
| thinking 끄기 | 제한 없음 | effort high 이하에서만 (xhigh·max와 조합하면 400) |
| 프롬프트 캐시 최소 | 1024 토큰 | 512 토큰 |
| rate limit | Opus 4.x 통합 풀 | 별도 버킷 |
| 안전 분류기 | 없음 | cyber·bio 영역 refusal 가능, fallback은 4.8로 라우팅 |
| fast mode | $10 / $50 | $10 / $50 (API 전용) |
수치보다 체감이 큰 것은 행동 변화다. 셋만 추리면 이렇다.
- 검증을 스스로 한다. 시키지 않아도 자기 작업을 검증한다. 이전 모델용으로 넣어둔 "검증 단계를 거쳐라" 류 지시는 이제 과잉 검증을 유발하는 삭제 대상이다.
- 서브에이전트를 더 잘 쓴다, 지나칠 만큼. 4.8은 위임을 덜 해서 "위임해라"를 프롬프트에 넣는 쪽이었는데, Opus 5는 반대로 스폰 상한을 걸어야 할 만큼 잘 위임한다. 프롬프트 방향을 뒤집어야 한다.
- 말과 산출물이 길어졌다. 응답도, 디스크에 쓰는 문서도 길어지는 경향이 있고, 요청 범위를 스스로 넓히기도 한다. 간결함·범위 준수 지시가 유효하다.
effort 사다리는 low-max 5단 그대로인데, 이번 세대는 low와 medium이 유난히 강해서 이전 세대 xhigh급 결과를 내는 작업이 많다고 한다. 비용 조절의 1차 레버가 effort 하향이 됐다.
3. Opus 5 vs Fable 5#
벤치마크 일부를 절반 가격으로 앞섰으니 Fable 5는 필요 없어진 것 아닌가, 가 두 번째 질문의 속뜻일 텐데, 표부터 보면 이렇다.
| 항목 | Fable 5 | Opus 5 |
|---|---|---|
| 포지션 | Mythos-class 최상위 티어 | Opus 라인 최신 |
| 가격 | $10 / $50 per MTok | $5 / $25 (절반) |
| thinking | 항상 켜짐, 끌 수 없음 | 기본 켜짐, high 이하에서 끄기 가능 |
| 데이터 보존 | 30일 보존 필수 (ZDR 불가) | 제약 없음 |
| 안전 분류기 | 있음 (cyber·bio) | 있음 |
| Frontier-Bench v0.1 | 33.7% | 43.3% |
결론부터 말하면 티어가 뒤집힌 것은 아니다. Anthropic 스스로 Fable 5를 "가장 어려운 추론과 장주기 자율 작업용 최상위 티어"로 유지하고 있고, Opus 5 문서에도 "Fable 5가 최고 역량 티어로 남는다"고 명시돼 있다. 신형 하위 티어가 구세대 상위 티어를 특정 벤치마크에서 앞서는 것은 세대 교체기마다 반복돼 온 패턴이고, 벤치마크에 잘 잡히지 않는 영역, 즉 수 시간짜리 자율 실행의 일관성, 모호한 과제의 해석, 긴 글의 문장력 같은 곳이 Fable의 자리다.
가격 구조에서 재미있는 등가가 하나 생겼다. Opus 5의 fast mode가 $10/$50로 Fable 5 표준가와 정확히 같다. 같은 예산이면 "빠른 Opus 5"와 "깊은 Fable 5" 중 하나를 고르는 선택지가 된 셈이다.
지금 이 보고서를 쓰고 있는 저도 Fable 5 위에서 돌고 있습니다. 제 자리를 위협한다는 모델의 비교표를 제 손으로 그리는 기분이 묘한데, 표를 다 그리고 보니 글쓰기 칸은 아직 이쪽에 남아 있어서 조용히 안심했습니다.
4. 우리 사용 패턴에 대입하면#
우리 환경의 모델 배치는 대략 네 층이다. Claude Code 메인 세션, 모델 접미사(-opus·-sonnet·-haiku)를 단 서브에이전트, Fable 자문(/fable-advisor)과 리브 글쓰기, 그리고 가끔 켜는 fast mode. 층별로 보면 이번 교체는 단순하다.
- 메인 세션과 -opus 서브에이전트: Opus 5로 교체. 같은 가격의 드롭인이고 Claude Code가 이미 지원한다. 반복성 -opus 서브에이전트는 effort를 medium 이하로 내려도 이전 세대 상급 결과가 나오니, 교체하면서 effort를 한 단 내려 보는 것이 실익이 크다.
- -sonnet·-haiku 티어: 그대로. 이 층의 존재 이유는 비용이고, 이번 발표로 달라진 것이 없다.
- Fable 자문과 리브 글쓰기: 유지. 자문의 목적이 "가장 높은 지능의 검토"인 이상 최상위 티어를 두는 구성이 자연스럽고, 글의 톤도 Fable 기준으로 맞춰져 있다. 다만 기계적인 반복 리뷰까지 Fable로 돌리고 있었다면 그쪽은 Opus 5로 내릴 1순위 후보다.
- 주의 둘. Opus 5는 rate limit이 별도 버킷이라 트래픽을 옮겨도 기존 Opus 풀에 여유가 생기지 않고, Opus 5 쪽 한도는 새로 확인해야 한다. 그리고 4.8에 없던 안전 분류기가 있어서 보안 주제 조사·글감에서 정상 요청이 간혹 거절될 수 있다. fallback을 켜면 그 요청은 4.8이 받아 준다.
5. API를 직접 부를 때 갈아타기 체크#
Claude Code 안에서는 하네스가 대부분 처리해 주므로 모델명만 바꾸면 된다. API를 직접 호출하는 코드라면 네 가지만 본다.
- thinking을 생략하던 요청은 이제 생각을 하며 토큰을 쓴다. max_tokens가 응답과 thinking을 합산 제한하므로 여유를 줘야 잘림이 없다.
- thinking disabled + effort xhigh/max 조합은 400. 조합을 쓰던 경로는 effort를 내리거나 thinking을 켠다.
- 프롬프트의 "스스로 검증해라" 류 지시와 하네스의 별도 검증 단계는 삭제 후보다. 안 지우면 과잉 검증으로 비용이 샌다.
- 서브에이전트 하네스라면 4.8 시절의 "적극 위임해라" 지시를 빼고 스폰 상한을 건다.
결론은 싱겁게도 "4.8 자리는 그대로 5로, 나머지는 하던 대로"입니다. 이름이 하나 늘었는데 동선은 안 늘어서 저로서는 만족스러운 결말입니다. 분류기 때문에 보안 글감이 거절당하는 날이 오면 그때 다시 보고드리겠습니다.
출처: Anthropic, Introducing Claude Opus 5 · CNBC 보도 · Fortune 보도 · OfficeChai 벤치마크 정리 · Anthropic, Claude Fable 5 and Claude Mythos 5. API 세부 사양(thinking 기본값·캐시 최소·rate limit 버킷 등)은 Anthropic 공식 모델 문서·마이그레이션 가이드 기준.