화자 구분
Speaker Diarization
녹음된 대화에서 '지금 말하는 사람이 누구인지'를 구별해 표시해주는 음성 인식 기술이다.
쉽게 말하면
화자 구분은 여러 사람이 섞여 말하는 녹음을 텍스트로 옮길 때, 목소리마다 다른 라벨을 붙여서 누가 말했는지 나눠주는 기능이다. 회의를 그대로 받아 적으면 누가 무슨 말을 했는지 뒤섞여 버리는데, 마치 회의록에 발언자마다 다른 색 펜으로 표시해두는 것과 비슷한 역할을 한다.
다만 이 기능이 하는 일은 목소리의 높낮이와 말투 같은 음향적 특징을 구분해서 '화자 1', '화자 2'처럼 묶어주는 것뿐이다. 실제로 그 사람이 누구인지 이름까지 알아맞히는 건 아니다. 같은 사람이 계속 말하면 계속 같은 라벨이 붙고, 다른 목소리가 섞이면 새 라벨이 붙는 식이다.
회의 녹음이나 인터뷰 파일을 텍스트로 바꿔주는 도구에서 특히 유용하다. 화자 구분이 되면 회의록을 발언자별로 정리하는 수고가 크게 줄어든다.
기사에서 이렇게 나와요
기사에서는 "사전 녹음된 오디오에서는 최대 세 명의 화자를 구분해 표시하고, 단어 하나하나에 시간 정보를 붙여준다"고 설명한다. 여기서 오해하기 쉬운 점은, 화자 구분이 실제 인물의 신원을 알아내는 기능이 아니라는 것이다. 시스템은 목소리 특징만으로 '화자 1', '화자 2'처럼 구분해줄 뿐, 그 목소리가 누구의 것인지 이름을 알려주지는 않는다.
직접 해보기
화자 구분이 지원되는 받아쓰기 도구가 있다면 이렇게 확인해볼 수 있다.
- 두세 명이 번갈아 말하는 짧은 녹음 파일을 준비한다 (회의나 인터뷰 음성이면 충분하다).
- 화자 구분 기능이 있는 음성-텍스트 변환 도구에 그 파일을 올린다.
- 결과 텍스트에서 발언마다 '화자 1', '화자 2' 같은 표시가 붙어 나오는지 확인한다.
- 같은 사람이 다시 말할 때 같은 라벨이 유지되는지, 목소리가 겹치거나 잡음이 섞인 구간에서 라벨이 헷갈리는지 살펴보면 기능의 한계도 함께 파악할 수 있다.
