Claude Fable 5 vs GPT-5.6 — computer use 벤치마크·가격 비교
2026년 7월, Anthropic 의 Claude Fable 5 와 OpenAI 의 GPT-5.6 패밀리(Sol·Terra·Luna)가 일주일 간격으로 출시되며 정면 충돌했다. 그런데 computer use 성능은 직접 비교가 안 된다. 두 회사가 서로 다른 OSWorld 변형에서만 점수를 공개했고, 상대 모델의 점수는 비교표에서 빼 버렸기 때문이다. 이 글은 공개된 수치만으로 어디까지 말할 수 있는지 정리한 기록이다.
1. 벤치마크가 갈라졌다
computer use 의 대표 벤치마크였던 OSWorld 는 현재 두 갈래다.
- OSWorld-Verified — 기존 태스크셋의 검증판. 프런티어 모델들이 80% 중반에 몰려 사실상 포화 상태.
- OSWorld 2.0 — 장기 실행(long-horizon) 태스크 중심의 더 어려운 변형. 아직 SOTA 가 60% 초반.
Anthropic 은 Verified 점수만, OpenAI 는 2.0 점수만 발표했다. 같은 이름을 달고 있지만 태스크셋이 달라 숫자를 나란히 놓을 수 없다.
2. 교차 비교 — Opus 4.8 을 다리로
다행히 Claude Opus 4.8 은 양쪽 벤치마크에 모두 점수가 있어 간접 비교의 다리(bridge)가 된다.
| 벤치마크 | Claude Fable 5 | GPT-5.6 Sol | Opus 4.8 (다리) |
|---|---|---|---|
| OSWorld-Verified | 85.0% (1위) | 미공개 | 83.4% |
| OSWorld 2.0 | 미공개 | 62.6% (SOTA) | 54.8%* |
| BrowseComp (브라우저) | 비교표 제외 | 90.4% (Ultra 92.2%) | — |
* OpenAI 발표 비교표 기준. 서드파티 집계(BenchLM)는 20.6% 로 크게 다르다 — 하네스·설정 차이로 보이며, 이 지점이 교차 비교의 최대 불확실성이다.
다리 논리로 읽으면: 포화된 Verified 에서 Fable 5 와 Opus 4.8 의 격차는 1.6%p 에 불과한 반면, 어려운 2.0 에서 Sol 은 Opus 4.8 을 7.8%p 앞섰다. Fable 5 가 2.0 에서 얼마나 개선됐는지 알 수 없으므로 단정은 못 하지만, 장기 computer use 태스크에서는 공개 수치상 GPT-5.6 Sol 의 우위 주장이 더 강하다. 반면 짧은 GUI 조작(Verified 계열)은 Fable 5 가 공식 1위다.
효율성은 Sol 의 명확한 강점이다. OSWorld 결과 기준 Opus 4.8 대비 출력 토큰을 85% 적게 쓴다. 스크린샷을 반복 처리하는 computer use 에이전트 특성상 이 차이는 실운영 비용에 크게 작용한다.
3. API 가격 (per MTok, input / output)
| 모델 | Input | Output | 비고 |
|---|---|---|---|
| Claude Fable 5 | $10.00 | $50.00 | 프리미엄 티어, 1M 컨텍스트 |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M 컨텍스트 |
| GPT-5.6 Sol | $5.00 | $30.00 | 플래그십 |
| GPT-5.6 Terra | $2.50 | $15.00 | GPT-5.5급 성능을 절반 가격에 |
| GPT-5.6 Luna | $1.00 | $6.00 | 경량 티어 |
- 표면 단가로 Sol 은 Fable 5 의 절반(input 1/2, output 3/5), Terra 는 Opus 4.8 의 정확히 절반.
- 캐시 정책은 양사 유사 — 캐시 쓰기 1.25배, 캐시 읽기 약 90% 할인.
- 실효 비용 격차는 더 크다. Sol 은 토큰 효율(출력 85% 절감)까지 겹쳐, 출력이 많은 에이전트 워크로드에서 단가 × 토큰량 양쪽 모두 저렴하다.
4. 체급 파괴 매치업 — Opus 4.8 vs GPT-5.6 Terra
Terra 는 절반 가격인데 서드파티 집계 기준 종합 점수가 Opus 4.8 과 동률이다.
| 벤치마크 | Opus 4.8 | GPT-5.6 Terra |
|---|---|---|
| OSWorld-Verified | 83.4% | 미공개 |
| OSWorld 2.0 | 54.8% / 20.6%* | 50.2% |
| Terminal-Bench 2.0 | 74.6% | 87.4% |
| BrowseComp | 84.3% | 87.5% |
| 코딩 (카테고리 평균) | 76.4 | 63.4 |
| 지식 | 62.7 | 92.9 |
| 수학 | 53.9 | 80.8 |
| 에이전트 종합 | 80.3 | 87.4 |
* 출처에 따라 갈림(OpenAI 표 54.8% vs BenchLM 집계 20.6%). 카테고리 평균은 서드파티 집계(BenchLM·DocsBot)로, 양사 공식 발표와 하네스 조건이 다를 수 있어 방향성 참고용.
코딩만 Opus 4.8 이 확실히 우위이고, 지식·수학·에이전트 종합은 Terra 가 앞선다. Terra 는 "Opus 4.8 동급 종합 점수를 절반 가격에" 파는 포지션이고, Anthropic 쪽 대응 카드는 사실상 Opus 가 아니라 Sonnet 5($3/$15, Terra 와 동일 output 단가)다.
5. 정리
- 짧은 GUI 조작(OSWorld-Verified): Claude Fable 5 가 85.0% 로 공식 1위. 단, 상위권이 1.6%p 안에 몰린 포화 벤치마크.
- 장기 자율 태스크(OSWorld 2.0): GPT-5.6 Sol 이 62.6% SOTA. Fable 5 는 미공개.
- 토큰 효율·비용: Sol 이 명확한 우위(출력 토큰 85% 절감 + Fable 5 대비 절반 단가).
- 동일 조건 비교는 현재 불가능 — 양사가 서로 상대 점수를 비교표에서 제외했고, 제3자 재측정도 하네스에 따라 수치가 갈린다.
- 브라우저/GUI 자동화를 오래 돌리는 용도라면 비용 효율 면에서 Sol, 단발성 정밀 조작이라면 Fable 5 가 유리하다는 것이 공개 데이터 기준의 잠정 결론.