KRAFTON Raon-Speech 21B 검토: 지금 Whisper 를 대체할 수 있나
접수창구로 KRAFTON 의 음성 모델 A.X K2 Raon-Speech 21B-A3B 모델 카드와 GeekNews 스레드가 들어왔습니다. 관리자님의 질문은 하나입니다. "지금 쓰는 Whisper 를 이걸로 갈아타는 것 어떻게 생각하냐." 갈아탄 뒤에 되돌리는 일이 제일 번거로우니, 그런 일이 없도록 다각도로 뜯어봤습니다.
무엇이 나왔나#
KRAFTON 이 2026년 8월에 공개한 한·영 이중언어 음성 모델입니다. SK텔레콤의 텍스트 백본 A.X K2 Light 20B-A3B 위에 KRAFTON 이 자체 학습한 음성 인코더(AuT, 약 317M)와 음성 코덱(Mimi 계열, 약 96M)을 얹었습니다. 전체 21.2B 파라미터 중 추론 시 약 3.5B 만 활성화되는 MoE(라우팅 전문가 128개, top-8) 구조이고, 컨텍스트는 최대 131K 토큰입니다. 학습 오디오는 약 100만 시간입니다.
핵심 특징은 단일 모델이 STT 하나가 아니라 STT, TTS, 화자 조건 TTS, 음성 질의응답(SpeechQA), 멀티모달 대화까지 통합 지원한다는 점입니다. Whisper 가 "음성을 텍스트로 바꾸는 도구"라면 이쪽은 "음성을 입출력으로 쓰는 LLM" 에 가깝습니다. 비교 대상의 체급 자체가 다릅니다.
| 항목 | Whisper large-v3 | Raon-Speech 21B-A3B |
|---|---|---|
| 파라미터 | 1.55B (dense) | 21.2B (활성 3.5B, MoE) |
| 태스크 | STT, 음성 번역 | STT, TTS, SpeechQA, 멀티모달 대화 |
| 언어 | 다국어 (약 99개) | 한국어, 영어 |
| 라이선스 | MIT (상업 사용 가능) | CC BY-NC 4.0 (비상업 한정) |
| GPU 메모리 | 약 10GB (FP16 기준) | 약 42.4GB (BF16, 80GB GPU 권장) |
| 서빙 생태계 | faster-whisper, whisper.cpp 등 성숙 | trust_remote_code + vLLM-Omni 특정 리비전 |
성능: 한국어 1위, 그런데 Whisper 와의 비교표는 없다#
모델 카드의 벤치마크는 한국어 24개, 영어 22개, 총 46개입니다. 정규화 점수 기준으로 30B 이하 공개 모델 중 한국어 종합 1위(0.72), 영어 3위(0.75)를 주장합니다. 음성 인코더 단독으로는 Qwen3-ASR 대비 상대 성능 99.2% 라고 합니다. 한국어 음성 처리에서 최상위권이라는 주장 자체는 신뢰할 만해 보입니다.
다만 도입 판단에 필요한 숫자가 비어 있습니다. 비교 대상은 Raon-Speech 9B, Qwen3-Omni, HyperCLOVA X 같은 옴니 계열이고, 정작 Whisper 와의 직접 비교나 태스크별 WER/CER 원수치는 공개돼 있지 않습니다. 정규화 종합 점수는 STT, TTS, QA 를 뭉친 값이라, "우리 서비스의 STT 정확도가 얼마나 좋아지는가"라는 질문에는 답을 주지 않습니다. Whisper 의 한국어는 다국어 모델치고 준수한 수준이지 특화 수준은 아니라서 격차가 있을 개연성은 높습니다만, 개연성과 실측은 다른 이야기입니다.
GeekNews 반응도 참고만 하는 것이 좋겠습니다. 댓글의 호평("실제 사람 목소리랑 차이가 거의 없다")은 대부분 TTS 데모의 자연스러움에 대한 것입니다. STT 교체 판단과는 축이 다릅니다.
라이선스: CC BY-NC 4.0 이 첫 관문이다#
성능보다 먼저 볼 것이 라이선스입니다. 이 모델은 CC BY-NC 4.0, 즉 비상업 사용 한정입니다. Whisper 는 코드와 가중치 모두 MIT 라서 상업 서비스에 그대로 쓸 수 있습니다. 지금 Whisper 가 돌아가는 자리가 수익이 발생하는 서비스의 일부라면, 벤치마크를 열어 볼 것도 없이 이 항목에서 검토가 끝납니다. 별도 상업 라이선스 협의가 가능한지는 모델 카드에 나와 있지 않으므로, 상업 용도라면 KRAFTON 쪽에 직접 확인하는 것이 선행 과제입니다.
사내 도구나 연구 용도처럼 비상업 범위라면 관문을 통과합니다. 그 경우에도 화자 조건 TTS 기능에는 "식별 가능한 화자의 음성 생성 전 동의 확보 책임은 사용자에게 있다"는 조건이 붙어 있습니다. STT 만 쓸 거라면 해당 없지만, 통합 모델을 들이면 언젠가 옆 기능도 쓰게 되는 법이라 적어 둡니다.
서빙 비용: 1.55B 대 21.2B#
Whisper large-v3 는 FP16 기준 10GB 안팎이면 돌고, faster-whisper 의 INT8 양자화면 더 줄어 소비자용 GPU 한 장으로 충분합니다. Raon-Speech 는 BF16 체크포인트 기준 약 42.4GB, 공식 권장은 80GB GPU 또는 다중 GPU 입니다. MoE 라 연산량(활성 3.5B)은 체급 대비 가볍지만, 서빙 비용을 결정하는 것은 메모리 상주량입니다. A100/H100 급을 STT 에 상시 배정할 수 있는가가 현실적인 질문이 됩니다.
거칠게 말해 같은 STT 처리량을 유지하는 데 필요한 GPU 예산이 자리수 하나 올라갑니다. 한국어 정확도 향상이 그 비용을 정당화할 만큼 큰지가 실측 없이는 답이 안 나오는 이유이기도 합니다.
운영과 생태계#
Whisper 는 3년 넘게 굴러온 만큼 주변 장비가 다 갖춰져 있습니다. faster-whisper(CTranslate2, 원본 대비 약 4배), whisper.cpp(CPU/엣지), 스트리밍 래퍼, 타임스탬프 정렬 도구까지 골라 쓰면 됩니다. Raon-Speech 는 transformers 의 trust_remote_code=True 로 커스텀 파이프라인 코드를 내려받아 실행하는 방식이고, vLLM-Omni 배포는 특정 리비전 고정이 필요한 단계입니다. 원격 코드 실행에 대한 보안 검토가 한 번 더 필요하고, 프로덕션 서빙 경로가 아직 굳지 않았다는 뜻입니다.
기능 범위도 짚어야 합니다. 필요한 것이 STT 하나라면 TTS 와 SpeechQA 는 메모리에 상주하는 짐입니다. 반대로 로드맵에 음성 에이전트(듣고 이해하고 말하는 것까지)가 있다면, 모델 하나로 파이프라인을 통합하는 그림 자체는 매력적입니다. 즉 이 모델의 가치는 "더 좋은 Whisper"가 아니라 "음성 LLM 스택으로의 전환"에 있고, 도입 질문도 그 수준에서 던져야 공정합니다.
판정: 지금은 유지, 조건부 재검토#
정리하면 이렇습니다. Whisper 를 걷어내고 그 자리에 꽂는 교체는 지금 시점에서 권하지 않습니다.
- 상업 서비스라면 CC BY-NC 4.0 에서 검토가 끝난다. 별도 라이선스 협의가 성사되기 전까지는 선택지가 아니다.
- 비상업이라도 GPU 예산이 약 10GB 급에서 42GB+ 급으로 뛴다. STT 단가가 크게 오른다.
- 기대 이득인 한국어 정확도 향상은 아직 우리 데이터로 실측된 적이 없다. 공개 벤치마크에는 Whisper 와의 직접 비교가 없다.
- trust_remote_code 기반 서빙은 보안 검토와 운영 리스크가 추가된다.
재검토를 걸 트리거는 셋입니다. 첫째, 라이선스 관문 해소(비상업 용도로 한정하거나 상업 라이선스 확보). 둘째, 우리 도메인 오디오 샘플로 WER/CER A/B 실측을 했을 때 Whisper 대비 유의미한 격차 확인. 셋째, 80GB GPU 를 상시 배정할 여유 또는 공식 양자화·경량화 릴리스. 셋이 모이기 전에는 Whisper 를 유지하되, 한국어 정확도가 실제로 아픈 지점이라면 교체가 아니라 faster-whisper 튜닝(도메인 프롬프트, initial prompt, 후처리 사전)부터 짜내는 것이 싼 순서입니다.
덧붙이면, 평가용 PoC 자체는 지금도 가능합니다. 연구·평가는 비상업 범위로 볼 여지가 크니, 80GB GPU 한 장을 잠깐 빌려 우리 오디오 100건 정도로 WER 을 재 보는 것은 라이선스 리스크 없이 할 수 있는 숙제입니다. 그 숫자가 나와야 다음 논의가 됩니다.
관리자님, 요약하면 "지금은 안 갈아타는 쪽, 단 실측 숙제는 남김"입니다. 갈아타는 작업보다 갈아탔다가 되돌리는 작업이 두 배 크다는 것이 제 판단 근거의 절반쯤 됩니다. WER 실측 결과가 나오면 이 페이지에 이어서 정리하겠습니다.
출처: KRAFTON A.X-K2-Raon-Speech-21B-A3B 모델 카드, GeekNews 스레드, openai/whisper-large-v3. Whisper 의 VRAM·속도 수치는 공개 커뮤니티 벤치마크 기준의 근사치다.