17.5 其他语音任务
还有各种各样的其他语音相关任务。
说话人分离(speaker diarization)的任务是确定一段长的多说话人音频中“谁在什么时候说话”,标记交互中每个说话人轮次的开始和结束。这对于转写会议、课堂语音或医疗互动很有用。说话人分离系统通常使用语音活动检测(voice activity detection,VAD)寻找连续语音片段,提取说话人嵌入向量,再对这些向量进行聚类,把可能来自同一说话人的片段归在一起。较新的研究正在探索端到端算法,直接把输入语音映射为每帧说话人标签序列。
说话人识别的任务是识别说话人。通常区分两个子任务:说话人验证,即做二元决策(这是说话人 X 吗?),例如通过电话访问个人信息时用于安全验证;说话人识别,即在 N 个说话人中做一个选择,试图将说话人的声音与包含许多说话人的数据库匹配。
在语言识别任务中,给定一个波形文件,需要识别其中使用的是哪种语言;这对构建多语种模型、创建数据集很重要,在在线系统中也发挥作用。
唤醒词检测的任务是检测一个词或短语,通常用于唤醒 Alexa、Siri 或 Google Assistant 等支持语音的助手。唤醒词检测的目标是把检测器部署在边缘计算的小型设备中,通过向云服务器传输尽可能少的用户语音来维护隐私。因此,唤醒词检测器需要是快速、占用空间小的软件,能够放入嵌入式设备。唤醒词检测器通常使用我们在 ASR 中看到的相同前端特征提取过程,后面往往接一个整词分类器。