오픈 ASR 리더보드
Open ASR Leaderboard
허깅페이스가 운영하는, 음성인식(ASR) 모델들을 공개 데이터셋으로 채점해 오류율 기준으로 줄 세운 리더보드.
该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。
简单来说
오픈 ASR 리더보드는 여러 회사가 만든 음성인식 AI를 같은 시험지로 채점해 한 줄로 세워 놓은 성적표 같은 것이다. 허깅페이스가 운영하며, LibriSpeech나 VoxPopuli 같은 공개 음성 데이터셋을 시험 문제로 써서, 모델이 사람 목소리를 얼마나 정확히 글자로 옮기는지 오류율로 점수를 매긴다.
문제는 이 시험 문제가 누구나 볼 수 있게 공개돼 있다는 점이다. 학교로 치면 전국 모의고사 문제지가 미리 유출된 셈인데, 일부 모델은 이 문제지 자체를 외워 버릴 수 있다. 최근 흄AI와 허깅페이스가 함께 진행한 연구에서는, 이 리더보드에서 상위권에 오른 모델 몇 개가 실제로는 오디오 소리를 듣지 않고 정답 문장을 통째로 기억해 맞힌 정황이 드러났다. 오디오에서 숫자를 완전히 지워도 30~40% 확률로 정답을 채워 넣은 것이 대표적인 예다.
그래서 이 리더보드에서 점수가 높다는 사실만으로 그 모델이 실제 상황에서도 정확하다고 단정할 수는 없다. 시험 문제(공개 데이터셋)에 익숙해진 것인지, 진짜로 소리를 잘 알아듣는 것인지 구분하려면 새로 녹음한 오디오로 다시 시험을 쳐 봐야 한다.
在报道中是这样出现的
기사는 '평가 점수가 가장 높은 축에 속하는 음성인식 모델'이 벤치마크 오디오에서 지워진 숫자를 그대로 맞혔다고 전한다. 흔히 하는 오해: 리더보드 순위가 높으면 실제 사용 환경에서도 그만큼 정확할 것이라 생각하기 쉽지만, 이 연구는 순위가 소리를 잘 알아듣는 능력이 아니라 정해진 시험 문제(VoxPopuli, LibriSpeech)를 얼마나 외웠는지를 반영할 수도 있음을 보여준다.