说话人分离
Speaker Diarization
一种语音识别技术,能在录音对话中识别并标注出'现在是谁在说话'。
简单来说
说话人分离是这样一种功能:在把多人交谈的录音转成文字时,给每个人的声音贴上不同的标签,从而区分出是谁说的话。如果把会议原样转录成文字,谁说了什么很容易混在一起,这项功能就像在会议记录里用不同颜色的笔标出每位发言人一样。
不过,这项功能实际做的事,只是根据音调、语气等声学特征把声音归类,标注成'说话人1'、'说话人2'之类,并不能真正认出这个人叫什么名字。只要是同一个人持续说话,就会一直贴同一个标签;一旦换成别的声音,就会出现新标签。
这项功能在把会议录音或采访文件转成文字的工具中尤其有用。有了说话人分离功能,按发言人整理会议记录的工作量会大大减少。
在报道中是这样出现的
文章中提到,"对于预先录制的音频,最多可以区分并标注三位说话人,并为每个单词都附上时间信息。" 这里容易产生的误解是,说话人分离并不能识别出真实身份。系统只是根据声音特征把说话人区分为'说话人1'、'说话人2'等,并不会告诉你这个声音究竟是谁的。
亲手试一试
如果你有支持说话人分离功能的听写工具,可以这样试试看。
- 准备一段两三个人轮流说话的简短录音(会议或采访录音即可)。
- 把这段录音上传到具有说话人分离功能的语音转文字工具中。
- 查看转录结果中每句话是否都标注了'说话人1'、'说话人2'之类的标签。
- 观察同一个人再次发言时是否保持相同标签,以及在声音重叠或有噪音的片段中标签是否出现混乱,这样也能了解这项功能的局限性。
