17.4 TTS 评估
TTS 系统通常由人类评估:向听者播放一段话语,请他们给出平均意见分(mean opinion score,MOS),即对合成话语质量的评分,通常采用 1–5 分制。随后,可以在相同句子上比较不同系统的 MOS 分数(例如使用配对 检验判断差异是否显著)。
如果比较的恰好是两个系统(例如想知道某项修改是否真正改善了系统),还可以使用 CMOS(Comparative MOS,比较平均意见分)。听者需要选择两个话语中哪个更好。CMOS 分数范围为 -3(系统明显比参考系统差)到 3(系统优于参考系统)。我们播放两个不同系统合成的同一句子,让听者选择更喜欢哪一个。对比如 50 个句子(随机呈现)后,比较两个系统各自被偏好的句子数量。
虽然语音合成系统最好由人类听者评估,但一些自动指标也能提供额外信息。例如,可以把输出送入 ASR 系统并计算词错误率(WER),以了解合成输出的鲁棒性。或者,为了衡量 TTS 系统输出的声音与登记声音的匹配程度,可以把任务视为说话人验证:将两个声音送入说话人验证系统,并使用所得分数作为相似度分数。