한국어 음성 AI(S2S) 인사이트 — Open Ko-S2S Leaderboard

RTX 4090 직접 실측 · HuggingFace 전수 조사 · 총 6개 인사이트 · 🏆 리더보드 보기

2026-07 · "omni라고 다 한국어 전사를 하는 게 아니다"

다국어 omni/음성 LLM을 한국어 ASR로 실측하니 모델마다 한국어 처리 방식이 완전히 다릅니다.

  • Qwen2.5-Omni-7B: 한국어 CER 9.78% — omni인데도 whisper-medium급 verbatim 전사. 3B는 38.55%로 스케일 격차가 큼.
  • MiniCPM-o-2.6: verbatim 전사 불가 — 한국어 오디오를 들으면 영어/중국어로 번역해 답합니다(어떤 프롬프트로도 원문 전사 안 됨). 음성 이해/번역 모델이지 ASR이 아님 → CER ~100%.

교훈: "audio를 받는다"와 "받아쓴다"는 다릅니다. omni를 ASR 리더보드에 올릴 땐 verbatim 전사 여부를 반드시 검증해야 합니다.

🏗️ 아키텍처

오디오 인코더Thinker(LLM·텍스트)Talker(음성 토큰)Code2wav스트리밍 디코더Qwen2.5-Omni: Thinker–Talker 이중 트랙 + TMRoPE 시간정렬
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
Qwen2.5-OmniThinker–Talker 이중 트랙(텍스트+음성 동시 생성), TMRoPE 위치인코딩, 블록 스트리밍다국어 오디오–텍스트 정렬 사전학습 + 음성토큰 학습verbatim 다국어 ASR 가능 — 한국어 CER 9.78%(7B)
MiniCPM-o-2.6omnimodal live streaming, 시분할 멀티플렉싱, audio→LLM 이해중·영 중심 멀티모달 지시학습오디오를 '이해'해 번역·요약 → verbatim 전사 아님(한국어 ~100%)

2026-07 · Nvidia Parakeet는 한국어를 지원하지 않는다

HF의 실시간 음성대화 데모 HF Realtime Voice(smolagents)의 파이프라인을 뜯어보니 VAD → Nvidia Parakeet(STT) → Gemma(LLM) → Qwen3-TTS였습니다. 그런데 Parakeet-TDT-0.6B-v3는 유럽어 25종만 지원(한국어 없음).

교훈: 최첨단 실시간 S2S 데모라도 STT가 한국어를 못 하면 한국어 사용자에겐 무용지물입니다. 기능은 완성형이어도 언어 커버리지를 반드시 확인해야 합니다. → 이런 시스템은 "비한국어 S2S" 카탈로그로 분리.

🏗️ 아키텍처

오디오FastConformer인코더TDT 디코더(토큰+지속시간)텍스트Nvidia Parakeet-TDT: FastConformer + TDT(RNN-T 변형, blank 건너뛰기)
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
Parakeet-TDTFastConformer + TDT(Token-and-Duration Transducer): blank 스킵 고속 디코딩영어+유럽어 25종 대규모 ASR 코퍼스(한국어 없음)매우 빠르고 정확하나 한국어 미지원
HF Realtime VoiceVAD→Parakeet(STT)→Gemma(LLM)→Qwen3-TTS cascade · OpenAI Realtime 프로토콜구성요소별 사전학습 결합실시간 S2S 기능은 완성형이나 STT가 한국어 불가

2026-07 · 한국어 네이티브 S2S는 HuggingFace에 사실상 없다

HF에서 speech-to-speech/SpeechLM을 전수 검색한 결과, 한국어 네이티브 end-to-end S2S 모델은 사실상 0개였습니다(t5 spoken↔written 텍스트 변환 정도). 반면 다국어 omni는 471개 후보.

교훈: 한국어 실시간 1:1 상담 경험을 end-to-end로 측정·보장하는 공개 리더보드가 없었던 이유. 오픈 경로는 사실상 cascade(STT+LLM+TTS) 뿐이며, 이것이 이 리더보드의 존재 이유입니다.

🏗️ 아키텍처

🎙️ 음성STTfaster-whisperLLMQwen2.5-3BTTSMMS🔊 음성한국어 오픈 S2S의 사실상 유일한 경로: STT→LLM→TTS cascade
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
Cascade (기준선)세 모델 순차 연결, 구성요소별 지연 합산 측정각 구성요소 개별 학습(전이)v2v 지연 ~149ms, 한국어 end-to-end 측정 가능
Native S2S단일 모델 end-to-end 음성 생성한국어 네이티브 학습 데이터 부재한국어 네이티브 공개 모델 사실상 0개

2026-07 · 한국어 STT는 풍부, TTS는 희소

HF 전수 조사: 한국어 STT 122개 vs TTS 13개.

  • STT는 Whisper 파인튜닝이 다수지만 절반이 wav2vec2 CTC·HuBERT(kresnik/wav2vec2-large-xlsr-korean는 87만 다운로드) — Whisper 백엔드와 호환 안 됨.
  • in-domain 파인튜닝의 위력: Zeroth로 파인튜닝한 모델(o0dimplz0o)은 같은 Zeroth 테스트에서 CER 1.53%로, 범용 large-v3-turbo(5.5%)를 크게 앞섭니다. 단, 도메인 밖 성능은 별개.
  • TTS는 프레임워크가 제각각(MMS·MeloTTS·SpeechT5·tacotron2·Qwen3-TTS)이라 통합 평가가 어렵습니다. 발음 정확도는 round-trip(TTS→ASR→CER) 으로 측정 — MMS 14.59%.

🏗️ 아키텍처

오디오특징 인코더Whisper: 디코더(생성) / wav2vec2: CTC텍스트Whisper=seq2seq 생성 · wav2vec2/HuBERT=인코더+CTC(비생성)
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
Whisper 파인튜닝인코더–디코더 seq2seq, 언어토큰 조건 자기회귀 생성68만시간 약지도 → Zeroth in-domain 파인튜닝verbatim 우수 — in-domain CER 1.53%
wav2vec2 / HuBERTCNN 특징 + Transformer + CTC(비자기회귀)자기지도 사전학습(XLS-R) + 한국어 파인튜닝generate 없음 → Whisper 백엔드 비호환(CTC 전용 필요)
MMS-TTSVITS(정규화 흐름 + adversarial 학습)1100+ 언어 다국어 학습한국어 합성 가능, 발음 round-trip CER 14.59%

2026-07 · 한국어 LLM: Trillion-7B가 KMMLU 최고

KMMLU 5-shot(45과목) 실측: Trillion-7B-preview 46.7%가 한국어 최고. SOLAR-10.7B 40.9%, HyperCLOVAX-1.5B 35.1%. 참고로 Qwen2.5-3B도 46.7%로 한국어에 의외로 강함.

교훈: 파라미터 크기보다 한국어 데이터 비중이 KMMLU를 좌우합니다(Trillion 7B ≈ Qwen 3B > SOLAR 10.7B).

🏗️ 아키텍처

한국어 텍스트디코더-onlyTransformer다음 토큰 예측KMMLUloglikelihooddecoder-only LM + KMMLU 5-shot loglikelihood 평가
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
Trillion-7B디코더-only Transformer, 다음토큰 예측한국어 비중 높은 사전학습 데이터 믹스KMMLU 46.7% — 7B 한국어 최고
SOLAR-10.7Bdepth up-scaling(레이어 확장)영어 중심 + 한국어 추가KMMLU 40.9%(크기 대비 낮음)
HyperCLOVAX-1.5B소형 decoder-only네이버 한국어 특화 학습KMMLU 35.1%(소형)

2026-07 · 인프라 노하우 — 분산 GPU로 재현 가능한 실측

  • 공유 GPU 존중: 4090은 다른 사용자와 공유 → 여유 VRAM 확인 후에만 작업(다른 사용자 프로세스 절대 안 건드림).
  • 무거운 omni는 detached 실행: 대용량 출력을 한 번에 보내면 유실되므로, nohup 백그라운드 + 결과 파일 폴링.
  • 모델별 전용 venv: omni마다 의존성(CUDA/torchvision/torchaudio)이 충돌 → 격리.
  • 측정한 것만 노출: 가짜 seed 제거, 외부 공개 수치는 출처와 함께 별도 탭으로 분리.

<!--

🏗️ 아키텍처

Mac오케스트레이터DureClawPhoenix 버스4090 에이전트(detached)병합 →리더보드분산 실측 파이프라인 — 공유 GPU 존중 + detached 실행
모식도(단순화). 정확한 구조는 각 모델 원문 참조.

🔑 핵심 알고리즘 · 학습 전략 · 효과

모델/시스템핵심 알고리즘핵심 학습 전략효과
분산 실측Phoenix [SHELL] 태스크 디스패치, nohup detached + 결과파일 폴링— (측정 인프라)무거운 omni도 타임아웃 없이 재현가능 실측
데이터 정합성측정치만 노출, 외부 수치는 출처와 분리 탭가짜 seed 제거 → 신뢰가능 리더보드