Moshi, 한국어 화자에게 쓸만한가
Kyutai 의 오픈소스 실시간 음성 대화 모델 Moshi 를 조사했다. 질문은 다섯 가지 — 한국어 화자에게 쓸만한가, 유료인가, Windows/Mac 에서 리눅스에 SSH 로 붙어 쓰는 환경에 맞는가, 돈이 얼마나 드는가, 더 나은 대안이 있는가.
질문 다섯 개를 한 문장에 담아 보내셨는데, 다행히 절반은 첫 번째 답에서 정리됩니다. 나머지는 대안 쪽에 시간을 썼습니다.
판정 요약
| 질문 | 답 | 근거 |
|---|---|---|
| 한국어 화자에게 쓸만한가 | 아니오 | 영어 전용 모델. 한국어를 알아듣지도, 말하지도 못한다 |
| 유료인가 | 무료 | 코드 MIT/Apache-2.0, 모델 웨이트 CC-BY-4.0. 유료 API 없음 |
| SSH 원격 환경에 맞는가 | 잘 맞음 | 서버-웹 UI 구조라 포트포워딩으로 그대로 쓸 수 있다 |
| 돈이 얼마나 드나 | GPU 값만 | 모델은 0원. 24GB 급 GPU 하나가 실질 비용 |
| 더 나은 대안 | 있음 | 한국어가 목적이면 Qwen3-Omni(오픈) 또는 OpenAI Realtime(상용) |
1. Moshi 는 무엇인가
Kyutai 는 파리의 오픈사이언스 AI 연구소이고, Moshi 는 이들이 2024년 9월 공개한 speech-text foundation model 이자 full-duplex 음성 대화 프레임워크다. 보통의 음성 비서가 "내가 말하고 → 끝나면 → AI 가 말하는" 무전기(half-duplex) 방식이라면, Moshi 는 사용자와 AI 의 오디오 스트림 두 개를 동시에 모델링해서 서로 끼어들며 말할 수 있다. 전화 통화에 가까운 방식이다.
- 구조: 7B 파라미터 Temporal Transformer + 소형 Depth Transformer. 응답 지연 실측 약 200ms.
- 오디오 코덱: 자체 개발한 스트리밍 뉴럴 코덱 Mimi 를 사용.
- 목소리: 여성 보이스 Moshika, 남성 보이스 Moshiko 두 종류.
- 백엔드 3종: PyTorch(연구용), MLX(Apple Silicon 로컬), Rust(프로덕션). 셋 다
localhost:8998웹 UI 를 띄운다. - 내부 독백: 말하면서 자기가 할 말의 텍스트 토큰을 함께 예측해 생성 품질을 끌어올리는 설계가 특징.
공개 후에도 프로젝트는 살아 있다. 2026년 들어서도 MoshiRAG(대화 중 비동기 지식 검색, 2026-04) 같은 후속 연구가 이어지고 있고, moshi.chat 에서 무료 데모를 바로 써 볼 수 있다.
2. 한국어 화자에게 — 결격
결론부터: Moshi 는 영어 전용이다. 학습 데이터가 영어 음성 대화이고, 공개된 모델(Moshika/Moshiko)은 한국어 음성을 이해하지도 생성하지도 못한다. 다국어 여부를 묻는 이슈 #62가 2024년 9월에 이미 올라왔고, 2026년 중반 현재까지 한국어를 포함한 다국어 대화 모델은 나오지 않았다. Kyutai 가 TTS 계열 모델의 다국어화를 진행 중이지만, full-duplex 대화 모델 Moshi 의 한국어 버전은 없다.
참고할 만한 것은 일본의 사례다. 나고야대 연구팀이 Moshi 를 일본어 음성 대화 데이터로 추가 학습해 J-Moshi 를 만들었다. 텍스트 어휘 교체와 2단계 학습(사전학습 + 파인튜닝)이 필요했고, 오디오 코덱 Mimi 는 일본어 음성을 추가 학습 없이 다룰 수 있어 얼렸다. 즉 한국어판도 기술적으로는 가능하지만, 대규모 한국어 음성 대화 코퍼스와 멀티 GPU 학습이 필요한 연구 프로젝트 규모의 일이고, 현재 공개된 한국어 파인튜닝판은 확인되지 않는다.
J-Moshi 곁가지는 버리지 않고 붙여 두었습니다. 언젠가 "한국어판은 왜 없나요" 가 다시 올 것 같아서요. 그때 이 문단만 가리키면 됩니다.
3. 유료인가 — 완전 무료
무료다. 파는 물건이 아니라 연구 결과물이다.
| 구성 요소 | 라이선스 | 비고 |
|---|---|---|
| Python 코드 (PyTorch/MLX) | MIT | 상업 이용 가능 |
| Rust 백엔드 | Apache-2.0 | 상업 이용 가능 |
| 모델 웨이트 전체 | CC-BY-4.0 | Hugging Face 에서 다운로드, 출처 표기만 하면 됨 |
| moshi.chat 데모 | 무료 | Kyutai 호스팅, 계정 불필요 |
유료 API 나 구독제가 아예 존재하지 않는다. 비용이 발생하는 지점은 단 하나, 모델을 돌릴 하드웨어다(§5).
4. SSH 원격 환경 — 구조상 잘 맞는다
사용 환경(Windows/Mac 클라이언트에서 리눅스 서버에 SSH 접속)과 Moshi 의 구조는 잘 맞는다. Moshi 는 처음부터 서버 프로세스 + 브라우저 웹 UI 로 설계되어 있어서, 리눅스 GPU 서버에 서버를 띄우고 SSH 포트포워딩으로 브라우저를 연결하면 끝이다.
# 리눅스 서버 (24GB 급 GPU)
pip install moshi
python -m moshi.server # localhost:8998 에서 대기
# Windows/Mac 쪽
ssh -L 8998:localhost:8998 user@server
# 이후 로컬 브라우저에서 http://localhost:8998 접속
짚어 둘 점 몇 가지.
- 마이크는 브라우저가 담당한다. SSH 터미널만으로는 쓸 수 없고, Windows/Mac 쪽 브라우저가 오디오 입출력을 맡는다. 포트포워딩된
localhost는 브라우저가 보안 컨텍스트로 취급하므로 마이크 권한도 문제없이 뜬다. - Mac 이라면 서버 없이 로컬 구동도 된다. MLX 백엔드가 Apple Silicon 용으로 제공되며, 4bit/8bit 양자화 모델을
python -m moshi_mlx.local_web으로 띄울 수 있다(M3 이상 권장). - VRAM 요구: PyTorch bf16 기준 24GB 이상. int8/int4 양자화(Rust·MLX 백엔드)로 요구량을 낮출 수 있다.
5. 돈이 얼마나 드나
모델이 무료이므로 비용 축은 하드웨어와, 비교를 위한 상용 API 요금이다.
| 경로 | 비용 | 비고 |
|---|---|---|
| moshi.chat 데모 | 0원 | 체험용. 세션 시간 제한 있음 |
| 보유 GPU (24GB 급, RTX 3090/4090 등) | 전기료뿐 | 이미 있다면 추가 비용 사실상 0 |
| Mac (Apple Silicon, M3+) | 0원 | MLX 4bit 양자화로 로컬 구동 |
| 클라우드 GPU 렌트 | 시간당 대략 $0.3-1 | 제공자·GPU 등급에 따라. 상시 구동엔 비효율 |
| (비교) OpenAI Realtime API | 분당 $0.06-0.11 실측 | gpt-realtime-2.1, 캐싱 적용 시. mini 는 $0.02-0.05 |
흥미로운 역전이 하나 있다. 시간당으로 환산하면 OpenAI Realtime 은 대략 $3.6-6.6 인데, 클라우드 GPU 렌트가 $0.3-1 이다. 오래, 자주 쓸수록 자가 호스팅이 싸진다. 다만 이 계산은 영어 대화 기준이고, 한국어 화자에게는 §2 때문에 애초에 성립하지 않는다.
6. 대안 — 한국어가 목적이라면 이쪽
| 대안 | 한국어 | 형태 | 비용 | 비고 |
|---|---|---|---|---|
| Qwen3-Omni (30B-A3B) | 입·출력 모두 | 오픈소스 자가 호스팅 | GPU 값만 | 음성 입력 19개·출력 10개 언어에 한국어 포함. MoE 구조로 실시간 스트리밍 응답. Moshi 의 오픈소스 정신 + 한국어를 원하면 현재 최선 |
| OpenAI Realtime API | 지원 | 상용 API | 분당 $0.06-0.11 | 가장 널리 쓰이는 실시간 음성 API. 품질·안정성 기준선. ChatGPT 앱의 음성 모드로 코드 없이 체험 가능 |
| Gemini Live API | 지원 | 상용 API | 사용량 과금 | Google 계열 대안. 이번 조사에서는 깊게 다루지 않았다 |
| STT + LLM + TTS 파이프라인 | 조합 가능 | 오픈소스 조합 | GPU 값만 | Whisper 계열 + LLM + 한국어 TTS(CosyVoice 2 등). 자유도는 높지만 full-duplex 가 아니라 턴 전환 지연이 크다 |
정리하면 용도가 갈린다. full-duplex 음성 대화라는 기술 자체가 궁금하면 Moshi(영어로 체험)가 여전히 가장 접근하기 쉬운 오픈소스 구현이고, 한국어로 실제 대화할 물건이 필요하면 자가 호스팅은 Qwen3-Omni, 관리형은 OpenAI Realtime API 가 답이다.
7. 결론
Moshi 는 완전 무료 오픈소스이고, 리눅스 서버 + SSH 포트포워딩 환경에 이상적으로 들어맞는 구조를 갖고 있다. 그러나 영어 전용이라는 한 가지 사실이 나머지 장점을 전부 무의미하게 만든다. 한국어 화자의 일상 사용 목적이라면 결론은 "Moshi 는 아니고, 같은 돈(0원)으로 Qwen3-Omni, 코드 없이 편하게는 OpenAI Realtime" 이다. 영어 회화 연습 상대나 full-duplex 아키텍처 학습 재료로는 지금도 충분히 가치가 있다.
결론이 "이건 아니고, 저쪽입니다" 로 끝나는 조사는 두 번 손댈 일이 없어서 좋아합니다. 대안 표까지 같이 넣어 두었으니 이 건은 여기서 닫겠습니다.
출처
- kyutai-labs/moshi — GitHub (구조·백엔드·라이선스·하드웨어 요구)
- Moshi: a speech-text foundation model for real-time dialogue — arXiv
- Is it multilingual? — issue #62
- nu-dialogue/j-moshi — 일본어 적응 사례 · 논문
- MoshiRAG — Kyutai 블로그 (2026-04)
- QwenLM/Qwen3-Omni — GitHub (지원 언어 목록)
- OpenAI API Pricing · Realtime API 실측 비용 분석 (2026)