🎙️ 한국어 ASR 모델 비교 — CER 숫자를 귀로 확인하기

Open Ko-S2S 리더보드 의 CER 수치가 실제 내 목소리에서 어떤 차이로 나타나는지 직접 들어보는 데모입니다. 같은 오디오를 4개 한국어 ASR 모델에 동시에 넣고, 전사 결과와 추론 시간을 나란히 보여줍니다.

이 데모가 보여주려는 것

  1. 낭독체 점수가 좋다고 자유발화도 잘하는 게 아닙니다. whisper-large-v3-turbo는 낭독체(Zeroth) CER **5.47%**로 이 중 최고지만, 자유발화(KsponSpeech)에서는 **12.53%**로 무너집니다. 반대로 73M짜리 whisper-base-komixv2는 낭독체 8.01% / 자유발화 7.71% 로 11배 큰 모델을 자유발화에서 이깁니다. 즉 10배 작은 모델이 실제 대화에서는 더 낫습니다.
  2. in-domain 점수는 점수가 아닙니다. wav2vec2-large-xlsr-korean은 Zeroth 낭독체에서 CER 1.78%를 자칭하지만, 그 Zeroth train으로 학습된 모델입니다(in-domain 오염). 빨간 배지가 붙은 모델의 점수는 다른 모델과 같은 선에서 비교하면 안 됩니다.

해보면 좋은 것: 원고를 또박또박 읽어보고 → 그다음 아무 준비 없이 말을 더듬으며 "어, 그러니까 그게…" 처럼 자유발화로 말해보세요. 두 경우의 모델 순위가 뒤집히는 걸 볼 수 있습니다.

⏱️ ZeroGPU 공용 GPU에서 돌아갑니다. 입력은 최대 30초까지만 처리하며, 첫 실행은 GPU 할당 대기 때문에 몇 초 더 걸릴 수 있습니다.

낭독체 예시 (Zeroth-Korean test · CC-BY-4.0) — 마이크가 없으면 이걸로 먼저

예시 정답: 몬터규는 자녀들이 사랑을 제대로 못 받고 크면 매우 심각한 결과가 초래된다는 결론을 내렸습니다

이 문장은 Zeroth-Korean test 셋 문장입니다. wav2vec2-large-xlsr-korean은 이 데이터셋 train으로 학습돼 고유명사 '몬터규'까지 정확히 맞히지만, 학습에서 이 도메인을 보지 않은 범용 모델들은 '몬토규'처럼 흔들립니다. 이게 in-domain 점수의 정체입니다.

모델 구성

  • seastar105/whisper-base-komixv2 (73M)
  • seastar105/whisper-small-komixv2 (242M)
  • openai/whisper-large-v3-turbo (809M)
  • kresnik/wav2vec2-large-xlsr-korean (317M) ⚠️ in-domain

수치 출처

  • 낭독체(Zeroth): Open Ko-S2S 리더보드 · Zeroth-Korean test (n=457) · CER(space-free) · RTX 4090 실측. wav2vec2-large-xlsr-korean만 모델 카드 자체 보고치(리더보드 미수록).
  • 자유발화: 동일 하네스의 KsponSpeech 평가. CTC 모델은 미측정().
  • 이 데모의 "이번 추론" 시간은 ZeroGPU(NVIDIA RTX Pro 6000 Blackwell) 위에서 측정한 값이라 리더보드의 RTX 4090 RTF와 직접 비교하면 안 됩니다. 모델 간 상대 비교용으로만 보세요.
  • CTC 모델은 띄어쓰기·구두점을 생성하지 않습니다. 전사가 붙어 나오는 건 버그가 아닙니다.