2026-07 · "omni라고 다 한국어 전사를 하는 게 아니다"
다국어 omni/음성 LLM을 한국어 ASR로 실측하니 모델마다 한국어 처리 방식이 완전히 다릅니다.
- Qwen2.5-Omni-7B: 한국어 CER 9.78% — omni인데도 whisper-medium급 verbatim 전사. 3B는 38.55%로 스케일 격차가 큼.
- MiniCPM-o-2.6: verbatim 전사 불가 — 한국어 오디오를 들으면 영어/중국어로 번역해 답합니다(어떤 프롬프트로도 원문 전사 안 됨). 음성 이해/번역 모델이지 ASR이 아님 → CER ~100%.
교훈: "audio를 받는다"와 "받아쓴다"는 다릅니다. omni를 ASR 리더보드에 올릴 땐 verbatim 전사 여부를 반드시 검증해야 합니다.
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| Qwen2.5-Omni | Thinker–Talker 이중 트랙(텍스트+음성 동시 생성), TMRoPE 위치인코딩, 블록 스트리밍 | 다국어 오디오–텍스트 정렬 사전학습 + 음성토큰 학습 | verbatim 다국어 ASR 가능 — 한국어 CER 9.78%(7B) |
| MiniCPM-o-2.6 | omnimodal live streaming, 시분할 멀티플렉싱, audio→LLM 이해 | 중·영 중심 멀티모달 지시학습 | 오디오를 '이해'해 번역·요약 → verbatim 전사 아님(한국어 ~100%) |
2026-07 · Nvidia Parakeet는 한국어를 지원하지 않는다
HF의 실시간 음성대화 데모 HF Realtime Voice(smolagents)의 파이프라인을 뜯어보니 VAD → Nvidia Parakeet(STT) → Gemma(LLM) → Qwen3-TTS였습니다. 그런데 Parakeet-TDT-0.6B-v3는 유럽어 25종만 지원(한국어 없음).
교훈: 최첨단 실시간 S2S 데모라도 STT가 한국어를 못 하면 한국어 사용자에겐 무용지물입니다. 기능은 완성형이어도 언어 커버리지를 반드시 확인해야 합니다. → 이런 시스템은 "비한국어 S2S" 카탈로그로 분리.
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| Parakeet-TDT | FastConformer + TDT(Token-and-Duration Transducer): blank 스킵 고속 디코딩 | 영어+유럽어 25종 대규모 ASR 코퍼스(한국어 없음) | 매우 빠르고 정확하나 한국어 미지원 |
| HF Realtime Voice | VAD→Parakeet(STT)→Gemma(LLM)→Qwen3-TTS cascade · OpenAI Realtime 프로토콜 | 구성요소별 사전학습 결합 | 실시간 S2S 기능은 완성형이나 STT가 한국어 불가 |
2026-07 · 한국어 네이티브 S2S는 HuggingFace에 사실상 없다
HF에서 speech-to-speech/SpeechLM을 전수 검색한 결과, 한국어 네이티브 end-to-end S2S 모델은 사실상 0개였습니다(t5 spoken↔written 텍스트 변환 정도). 반면 다국어 omni는 471개 후보.
교훈: 한국어 실시간 1:1 상담 경험을 end-to-end로 측정·보장하는 공개 리더보드가 없었던 이유. 오픈 경로는 사실상 cascade(STT+LLM+TTS) 뿐이며, 이것이 이 리더보드의 존재 이유입니다.
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| Cascade (기준선) | 세 모델 순차 연결, 구성요소별 지연 합산 측정 | 각 구성요소 개별 학습(전이) | v2v 지연 ~149ms, 한국어 end-to-end 측정 가능 |
| Native S2S | 단일 모델 end-to-end 음성 생성 | 한국어 네이티브 학습 데이터 부재 | 한국어 네이티브 공개 모델 사실상 0개 |
2026-07 · 한국어 STT는 풍부, TTS는 희소
HF 전수 조사: 한국어 STT 122개 vs TTS 13개.
- STT는 Whisper 파인튜닝이 다수지만 절반이 wav2vec2 CTC·HuBERT(kresnik/wav2vec2-large-xlsr-korean는 87만 다운로드) — Whisper 백엔드와 호환 안 됨.
- in-domain 파인튜닝의 위력: Zeroth로 파인튜닝한 모델(o0dimplz0o)은 같은 Zeroth 테스트에서 CER 1.53%로, 범용 large-v3-turbo(5.5%)를 크게 앞섭니다. 단, 도메인 밖 성능은 별개.
- TTS는 프레임워크가 제각각(MMS·MeloTTS·SpeechT5·tacotron2·Qwen3-TTS)이라 통합 평가가 어렵습니다. 발음 정확도는 round-trip(TTS→ASR→CER) 으로 측정 — MMS 14.59%.
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| Whisper 파인튜닝 | 인코더–디코더 seq2seq, 언어토큰 조건 자기회귀 생성 | 68만시간 약지도 → Zeroth in-domain 파인튜닝 | verbatim 우수 — in-domain CER 1.53% |
| wav2vec2 / HuBERT | CNN 특징 + Transformer + CTC(비자기회귀) | 자기지도 사전학습(XLS-R) + 한국어 파인튜닝 | generate 없음 → Whisper 백엔드 비호환(CTC 전용 필요) |
| MMS-TTS | VITS(정규화 흐름 + adversarial 학습) | 1100+ 언어 다국어 학습 | 한국어 합성 가능, 발음 round-trip CER 14.59% |
2026-07 · 한국어 LLM: Trillion-7B가 KMMLU 최고
KMMLU 5-shot(45과목) 실측: Trillion-7B-preview 46.7%가 한국어 최고. SOLAR-10.7B 40.9%, HyperCLOVAX-1.5B 35.1%. 참고로 Qwen2.5-3B도 46.7%로 한국어에 의외로 강함.
교훈: 파라미터 크기보다 한국어 데이터 비중이 KMMLU를 좌우합니다(Trillion 7B ≈ Qwen 3B > SOLAR 10.7B).
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| Trillion-7B | 디코더-only Transformer, 다음토큰 예측 | 한국어 비중 높은 사전학습 데이터 믹스 | KMMLU 46.7% — 7B 한국어 최고 |
| SOLAR-10.7B | depth up-scaling(레이어 확장) | 영어 중심 + 한국어 추가 | KMMLU 40.9%(크기 대비 낮음) |
| HyperCLOVAX-1.5B | 소형 decoder-only | 네이버 한국어 특화 학습 | KMMLU 35.1%(소형) |
2026-07 · 인프라 노하우 — 분산 GPU로 재현 가능한 실측
- 공유 GPU 존중: 4090은 다른 사용자와 공유 → 여유 VRAM 확인 후에만 작업(다른 사용자 프로세스 절대 안 건드림).
- 무거운 omni는 detached 실행: 대용량 출력을 한 번에 보내면 유실되므로, nohup 백그라운드 + 결과 파일 폴링.
- 모델별 전용 venv: omni마다 의존성(CUDA/torchvision/torchaudio)이 충돌 → 격리.
- 측정한 것만 노출: 가짜 seed 제거, 외부 공개 수치는 출처와 함께 별도 탭으로 분리.
<!--
🏗️ 아키텍처
모식도(단순화). 정확한 구조는 각 모델 원문 참조.🔑 핵심 알고리즘 · 학습 전략 · 효과
| 모델/시스템 | 핵심 알고리즘 | 핵심 학습 전략 | 효과 |
|---|
| 분산 실측 | Phoenix [SHELL] 태스크 디스패치, nohup detached + 결과파일 폴링 | — (측정 인프라) | 무거운 omni도 타임아웃 없이 재현가능 실측 |
| 데이터 정합성 | 측정치만 노출, 외부 수치는 출처와 분리 탭 | — | 가짜 seed 제거 → 신뢰가능 리더보드 |