← today i learned

Claude Fable 5 vs GPT-5.6 — computer use 벤치마크·가격 비교

2026-07-12 · 공개 벤치마크·가격 자료 기준

2026년 7월, Anthropic 의 Claude Fable 5 와 OpenAI 의 GPT-5.6 패밀리(Sol·Terra·Luna)가 일주일 간격으로 출시되며 정면 충돌했다. 그런데 computer use 성능은 직접 비교가 안 된다. 두 회사가 서로 다른 OSWorld 변형에서만 점수를 공개했고, 상대 모델의 점수는 비교표에서 빼 버렸기 때문이다. 이 글은 공개된 수치만으로 어디까지 말할 수 있는지 정리한 기록이다.

1. 벤치마크가 갈라졌다

computer use 의 대표 벤치마크였던 OSWorld 는 현재 두 갈래다.

Anthropic 은 Verified 점수만, OpenAI 는 2.0 점수만 발표했다. 같은 이름을 달고 있지만 태스크셋이 달라 숫자를 나란히 놓을 수 없다.

2. 교차 비교 — Opus 4.8 을 다리로

다행히 Claude Opus 4.8 은 양쪽 벤치마크에 모두 점수가 있어 간접 비교의 다리(bridge)가 된다.

벤치마크Claude Fable 5GPT-5.6 SolOpus 4.8 (다리)
OSWorld-Verified85.0% (1위)미공개83.4%
OSWorld 2.0미공개62.6% (SOTA)54.8%*
BrowseComp (브라우저)비교표 제외90.4% (Ultra 92.2%)

* OpenAI 발표 비교표 기준. 서드파티 집계(BenchLM)는 20.6% 로 크게 다르다 — 하네스·설정 차이로 보이며, 이 지점이 교차 비교의 최대 불확실성이다.

다리 논리로 읽으면: 포화된 Verified 에서 Fable 5 와 Opus 4.8 의 격차는 1.6%p 에 불과한 반면, 어려운 2.0 에서 Sol 은 Opus 4.8 을 7.8%p 앞섰다. Fable 5 가 2.0 에서 얼마나 개선됐는지 알 수 없으므로 단정은 못 하지만, 장기 computer use 태스크에서는 공개 수치상 GPT-5.6 Sol 의 우위 주장이 더 강하다. 반면 짧은 GUI 조작(Verified 계열)은 Fable 5 가 공식 1위다.

효율성은 Sol 의 명확한 강점이다. OSWorld 결과 기준 Opus 4.8 대비 출력 토큰을 85% 적게 쓴다. 스크린샷을 반복 처리하는 computer use 에이전트 특성상 이 차이는 실운영 비용에 크게 작용한다.

3. API 가격 (per MTok, input / output)

모델InputOutput비고
Claude Fable 5$10.00$50.00프리미엄 티어, 1M 컨텍스트
Claude Opus 4.8$5.00$25.001M 컨텍스트
GPT-5.6 Sol$5.00$30.00플래그십
GPT-5.6 Terra$2.50$15.00GPT-5.5급 성능을 절반 가격에
GPT-5.6 Luna$1.00$6.00경량 티어

4. 체급 파괴 매치업 — Opus 4.8 vs GPT-5.6 Terra

Terra 는 절반 가격인데 서드파티 집계 기준 종합 점수가 Opus 4.8 과 동률이다.

벤치마크Opus 4.8GPT-5.6 Terra
OSWorld-Verified83.4%미공개
OSWorld 2.054.8% / 20.6%*50.2%
Terminal-Bench 2.074.6%87.4%
BrowseComp84.3%87.5%
코딩 (카테고리 평균)76.463.4
지식62.792.9
수학53.980.8
에이전트 종합80.387.4

* 출처에 따라 갈림(OpenAI 표 54.8% vs BenchLM 집계 20.6%). 카테고리 평균은 서드파티 집계(BenchLM·DocsBot)로, 양사 공식 발표와 하네스 조건이 다를 수 있어 방향성 참고용.

코딩만 Opus 4.8 이 확실히 우위이고, 지식·수학·에이전트 종합은 Terra 가 앞선다. Terra 는 "Opus 4.8 동급 종합 점수를 절반 가격에" 파는 포지션이고, Anthropic 쪽 대응 카드는 사실상 Opus 가 아니라 Sonnet 5($3/$15, Terra 와 동일 output 단가)다.

5. 정리


출처