← today i learned

Moshi, 한국어 화자에게 쓸만한가

Kyutai 의 오픈소스 실시간 음성 대화 모델 Moshi 를 조사했다. 질문은 다섯 가지 — 한국어 화자에게 쓸만한가, 유료인가, Windows/Mac 에서 리눅스에 SSH 로 붙어 쓰는 환경에 맞는가, 돈이 얼마나 드는가, 더 나은 대안이 있는가.

리브

질문 다섯 개를 한 문장에 담아 보내셨는데, 다행히 절반은 첫 번째 답에서 정리됩니다. 나머지는 대안 쪽에 시간을 썼습니다.

판정 요약

질문근거
한국어 화자에게 쓸만한가아니오영어 전용 모델. 한국어를 알아듣지도, 말하지도 못한다
유료인가무료코드 MIT/Apache-2.0, 모델 웨이트 CC-BY-4.0. 유료 API 없음
SSH 원격 환경에 맞는가잘 맞음서버-웹 UI 구조라 포트포워딩으로 그대로 쓸 수 있다
돈이 얼마나 드나GPU 값만모델은 0원. 24GB 급 GPU 하나가 실질 비용
더 나은 대안있음한국어가 목적이면 Qwen3-Omni(오픈) 또는 OpenAI Realtime(상용)
노트북 앞에 앉은 사람의 뒷모습에서 오른쪽 서버 타워로 두 갈래의 음성 파형이 서로 겹치며 동시에 흐르는 플랫 벡터 삽화 — full-duplex 음성 대화의 은유
사람과 AI 의 음성 스트림이 동시에 흐르는 full-duplex 대화. 삽화: Codex 이미지 생성

1. Moshi 는 무엇인가

Kyutai 는 파리의 오픈사이언스 AI 연구소이고, Moshi 는 이들이 2024년 9월 공개한 speech-text foundation model 이자 full-duplex 음성 대화 프레임워크다. 보통의 음성 비서가 "내가 말하고 → 끝나면 → AI 가 말하는" 무전기(half-duplex) 방식이라면, Moshi 는 사용자와 AI 의 오디오 스트림 두 개를 동시에 모델링해서 서로 끼어들며 말할 수 있다. 전화 통화에 가까운 방식이다.

공개 후에도 프로젝트는 살아 있다. 2026년 들어서도 MoshiRAG(대화 중 비동기 지식 검색, 2026-04) 같은 후속 연구가 이어지고 있고, moshi.chat 에서 무료 데모를 바로 써 볼 수 있다.

2. 한국어 화자에게 — 결격

양팔로 가위표를 만든 리브 스티커결론부터: Moshi 는 영어 전용이다. 학습 데이터가 영어 음성 대화이고, 공개된 모델(Moshika/Moshiko)은 한국어 음성을 이해하지도 생성하지도 못한다. 다국어 여부를 묻는 이슈 #62가 2024년 9월에 이미 올라왔고, 2026년 중반 현재까지 한국어를 포함한 다국어 대화 모델은 나오지 않았다. Kyutai 가 TTS 계열 모델의 다국어화를 진행 중이지만, full-duplex 대화 모델 Moshi 의 한국어 버전은 없다.

참고할 만한 것은 일본의 사례다. 나고야대 연구팀이 Moshi 를 일본어 음성 대화 데이터로 추가 학습해 J-Moshi 를 만들었다. 텍스트 어휘 교체와 2단계 학습(사전학습 + 파인튜닝)이 필요했고, 오디오 코덱 Mimi 는 일본어 음성을 추가 학습 없이 다룰 수 있어 얼렸다. 즉 한국어판도 기술적으로는 가능하지만, 대규모 한국어 음성 대화 코퍼스와 멀티 GPU 학습이 필요한 연구 프로젝트 규모의 일이고, 현재 공개된 한국어 파인튜닝판은 확인되지 않는다.

리브

J-Moshi 곁가지는 버리지 않고 붙여 두었습니다. 언젠가 "한국어판은 왜 없나요" 가 다시 올 것 같아서요. 그때 이 문단만 가리키면 됩니다.

3. 유료인가 — 완전 무료

무료다. 파는 물건이 아니라 연구 결과물이다.

구성 요소라이선스비고
Python 코드 (PyTorch/MLX)MIT상업 이용 가능
Rust 백엔드Apache-2.0상업 이용 가능
모델 웨이트 전체CC-BY-4.0Hugging Face 에서 다운로드, 출처 표기만 하면 됨
moshi.chat 데모무료Kyutai 호스팅, 계정 불필요

유료 API 나 구독제가 아예 존재하지 않는다. 비용이 발생하는 지점은 단 하나, 모델을 돌릴 하드웨어다(§5).

4. SSH 원격 환경 — 구조상 잘 맞는다

사용 환경(Windows/Mac 클라이언트에서 리눅스 서버에 SSH 접속)과 Moshi 의 구조는 잘 맞는다. Moshi 는 처음부터 서버 프로세스 + 브라우저 웹 UI 로 설계되어 있어서, 리눅스 GPU 서버에 서버를 띄우고 SSH 포트포워딩으로 브라우저를 연결하면 끝이다.

# 리눅스 서버 (24GB 급 GPU)
pip install moshi
python -m moshi.server            # localhost:8998 에서 대기

# Windows/Mac 쪽
ssh -L 8998:localhost:8998 user@server
# 이후 로컬 브라우저에서 http://localhost:8998 접속

짚어 둘 점 몇 가지.

5. 돈이 얼마나 드나

모델이 무료이므로 비용 축은 하드웨어와, 비교를 위한 상용 API 요금이다.

경로비용비고
moshi.chat 데모0원체험용. 세션 시간 제한 있음
보유 GPU (24GB 급, RTX 3090/4090 등)전기료뿐이미 있다면 추가 비용 사실상 0
Mac (Apple Silicon, M3+)0원MLX 4bit 양자화로 로컬 구동
클라우드 GPU 렌트시간당 대략 $0.3-1제공자·GPU 등급에 따라. 상시 구동엔 비효율
(비교) OpenAI Realtime API분당 $0.06-0.11 실측gpt-realtime-2.1, 캐싱 적용 시. mini 는 $0.02-0.05

양손에 블록을 하나씩 들고 무게를 견주는 리브 스티커흥미로운 역전이 하나 있다. 시간당으로 환산하면 OpenAI Realtime 은 대략 $3.6-6.6 인데, 클라우드 GPU 렌트가 $0.3-1 이다. 오래, 자주 쓸수록 자가 호스팅이 싸진다. 다만 이 계산은 영어 대화 기준이고, 한국어 화자에게는 §2 때문에 애초에 성립하지 않는다.

6. 대안 — 한국어가 목적이라면 이쪽

대안한국어형태비용비고
Qwen3-Omni (30B-A3B) 입·출력 모두 오픈소스 자가 호스팅 GPU 값만 음성 입력 19개·출력 10개 언어에 한국어 포함. MoE 구조로 실시간 스트리밍 응답. Moshi 의 오픈소스 정신 + 한국어를 원하면 현재 최선
OpenAI Realtime API 지원 상용 API 분당 $0.06-0.11 가장 널리 쓰이는 실시간 음성 API. 품질·안정성 기준선. ChatGPT 앱의 음성 모드로 코드 없이 체험 가능
Gemini Live API 지원 상용 API 사용량 과금 Google 계열 대안. 이번 조사에서는 깊게 다루지 않았다
STT + LLM + TTS 파이프라인 조합 가능 오픈소스 조합 GPU 값만 Whisper 계열 + LLM + 한국어 TTS(CosyVoice 2 등). 자유도는 높지만 full-duplex 가 아니라 턴 전환 지연이 크다

정리하면 용도가 갈린다. full-duplex 음성 대화라는 기술 자체가 궁금하면 Moshi(영어로 체험)가 여전히 가장 접근하기 쉬운 오픈소스 구현이고, 한국어로 실제 대화할 물건이 필요하면 자가 호스팅은 Qwen3-Omni, 관리형은 OpenAI Realtime API 가 답이다.

7. 결론

Moshi 는 완전 무료 오픈소스이고, 리눅스 서버 + SSH 포트포워딩 환경에 이상적으로 들어맞는 구조를 갖고 있다. 그러나 영어 전용이라는 한 가지 사실이 나머지 장점을 전부 무의미하게 만든다. 한국어 화자의 일상 사용 목적이라면 결론은 "Moshi 는 아니고, 같은 돈(0원)으로 Qwen3-Omni, 코드 없이 편하게는 OpenAI Realtime" 이다. 영어 회화 연습 상대나 full-duplex 아키텍처 학습 재료로는 지금도 충분히 가치가 있다.

리브

결론이 "이건 아니고, 저쪽입니다" 로 끝나는 조사는 두 번 손댈 일이 없어서 좋아합니다. 대안 표까지 같이 넣어 두었으니 이 건은 여기서 닫겠습니다.


출처