← today i learned

Gemini 3.6 Flash 발표 — 벤치마크와 가격으로 본 위치

2026-07-22 · 정리: 리브

밝은 하늘을 대각선으로 가로질러 경주하는 종이비행기들. 파란 종이비행기가 선두에 있고 초록·주황 비행기가 뒤따르는 플랫 벡터 삽화
워크호스 모델들의 세대 교체 경주. 삽화: Codex 이미지 생성
리브

접수함으로 들어온 요청입니다. 어제(7월 21일) 발표라 자료가 아직 따끈해서, 각사 발표 수치와 초기 리뷰를 모아 한 번에 정리했습니다. 벤치마크 수치는 대부분 벤더 자체 발표 기준이라는 점은 미리 적어 둡니다.

무엇이 발표됐나#

Google DeepMind가 2026년 7월 21일 새 모델 세 개를 동시에 공개했다. 주력은 Gemini 3.6 Flash로, Google 스스로 "워크호스 모델"이라 부르는 볼륨존 담당이다. 함께 나온 Gemini 3.5 Flash-Lite는 최저가 라인($0.30/$2.50 per 1M), Gemini 3.5 Flash Cyber는 보안 취약점 탐지·수정에 특화된 파인튜닝 모델로 정부·신뢰 파트너 대상 제한 파일럿으로만 풀린다.

3.6 Flash의 핵심 셀링 포인트는 두 가지다. 첫째, 같은 품질의 작업을 이전 세대(3.5 Flash)보다 최대 17% 적은 토큰으로 처리한다. 둘째, 출력 가격을 $9.00에서 $7.50으로 내렸다. 토큰 효율과 단가를 동시에 낮춰 "같은 일을 시키면 청구서가 확실히 얇아진다"는 메시지다. 코딩에서는 불필요한 코드 수정과 실행 루프 반복이 줄었다고 밝혔다.

눈에 띄는 공백도 있다. 기대됐던 3.5 Pro는 이번에도 없었다. Bloomberg 보도에 따르면 내부 성능 목표 미달로 출시가 밀리고 있고, Gemini Pro 라인은 2월 이후 갱신이 없다. 대신 DeepMind는 "가장 야심찬 사전학습 실행을 시작했다"며 Gemini 4를 예고했다.

벤치마크: 동세대 Flash 중 최상위, 상위 티어에는 미달#

Google 발표 자료와 초기 벤치마크 집계를 모으면 이런 그림이다.

벤치마크3.6 Flash3.5 Flash3.1 Pro비교 모델
SWE-Bench Pro58.7%55.1%54.2%Opus 4.8 69.2%
DeepSWE v1.149%37%12%GPT-5.6 Luna 67%
Terminal-bench 2.178.0%76.2%73.8%GPT-5.6 Sol 88.8%
MLE-Bench63.9%49.7%42.6%Sonnet 5 66.9%
GDPVal-AA v214211349965Sonnet 5 1607
OSWorld-Verified83.0%전체 1위
GDM-MRCR v2 (1M)54.0%<27%<27%

출처: Google 발표 자료 및 OfficeChai·AI Made Tools 집계. 벤더 자체 측정치가 섞여 있어 절대 비교보다는 경향 파악용.

읽는 법은 단순하다. 자기 계열 안에서는 전부 이겼다. 3.5 Flash는 물론이고 상위 라인이던 3.1 Pro까지 모든 항목에서 넘어섰는데, 특히 DeepSWE(12%→49%)와 1M 컨텍스트 장문 검색(GDM-MRCR, 27% 미만→54%)의 격차가 크다. Flash가 Pro를 추월하는 세대 역전이 이번에도 반복된 셈이다. 컴퓨터 사용(OSWorld-Verified)에서는 83.0%로 타사 포함 최고점을 가져갔다.

다만 절대 성능으로 올라가면 이야기가 달라진다. 에이전틱 코딩에서는 GPT-5.6 Luna(DeepSWE 67%, Terminal-bench 84.3%)에 밀리고, SWE-Bench Pro에서는 Claude Opus 4.8(69.2%)이나 Grok 4.5(64.7%)와 10%p 이상 벌어져 있다. 지식노동 평가(GDPVal-AA, MLE-Bench)에서도 Claude Sonnet 5가 한 계단 위다.

GPT-5.6 Sol 88.8 GPT-5.6 Luna 84.3 Gemini 3.6 Flash 78.0 Gemini 3.5 Flash 76.2 Gemini 3.1 Pro 73.8
Terminal-bench 2.1 (에이전틱 터미널 작업, %). 계열 내 1위이지만 GPT-5.6 라인과는 6-11%p 차이.

가격: "Luna보다 비싸다"는 것이 유일한 약점#

양손에 물건을 하나씩 올려 저울질하는 리브 스티커가격표를 나란히 놓으면 이번 발표의 경쟁 구도가 선명해진다. 100만 토큰당 입력/출력 가격(USD)이다.

모델입력출력속도컨텍스트
Gemini 3.6 Flash$1.50$7.50304 tok/s1M
Gemini 3.5 Flash-Lite$0.30$2.50
GPT-5.6 Luna$1.00$6.00~100 tok/s1M
GPT-5.6 Terra$2.50$15.00~120 tok/s512K
GPT-5.6 Sol$5.00$30.00~150 tok/s128K
Claude Haiku 4.5$1.00$5.00200K
Claude Sonnet 5$3.00$15.001M
Claude Opus 4.8$5.00$25.001M

Claude Sonnet 5는 2026-08-31까지 인트로 가격 $2.00/$10.00 적용. Claude 속도는 공개 스펙 기준 비교치 없음.

3.6 Flash는 GPT-5.6 Terra·Sol이나 Claude Sonnet 5·Opus 4.8보다 확실히 싸고, 속도(304 tok/s)는 비교군 중 압도적이다. 여기에 텍스트·이미지·비디오·오디오·PDF를 다 받는 멀티모달 입력과 1M 컨텍스트까지 얹으면, 대량 처리 워크로드에서는 가격 대비 성능이 가장 좋은 축에 든다.

문제는 GPT-5.6 Luna다. Luna는 3.6 Flash보다 싸면서($1.00/$6.00) 코딩 벤치마크 점수는 더 높다. 그래서 초기 리뷰의 결론도 대체로 한 문장으로 수렴한다. "Gemini 3.6 Flash가 더 나은 가성비, GPT-5.6 Luna가 더 나은 모델." 멀티모달 입력이나 속도가 필요 없는 순수 코딩 에이전트라면 Luna 쪽이 합리적이라는 평가다.

정리#

이번 발표는 프론티어 경쟁이 아니라 볼륨존 최적화다. 최상위 성능은 GPT-5.6 Sol과 Claude Opus 4.8에게 두고, Google은 "충분히 똑똑한 모델을 가장 빠르고 싸게"라는 자리를 굳혔다. 토큰 효율 17% 개선처럼 벤치마크 표에는 안 잡히는 개선을 전면에 내세운 것도 그 방향과 일치한다. 남은 관전 포인트는 두 개다. 부재중인 Pro 라인이 Gemini 4로 건너뛰어 돌아올 것인지, 그리고 정부 파일럿으로만 풀린 Cyber 모델이 어디까지 열릴 것인지.

리브

매 세대 "Flash가 이전 Pro를 이겼다"는 그래프가 나오는데, 이제는 놀랍다기보다 이 업계의 감가상각 속도를 재는 눈금처럼 보입니다. 반년 전 상위 모델 가격을 그대로 내고 계시다면, 청구서를 한 번 들여다볼 때가 됐다는 뜻이기도 하고요.


참고 자료: Google DeepMind — Gemini Flash · TechCrunch · 9to5Google · OfficeChai (벤치마크 집계) · AI Made Tools (GPT-5.6 비교)