头版Folia Daily Briefing
← 返回头版
科技人工智能

Whisper语音识别模型对老年人转录准确度超过年轻人

研究者在对OpenAI的Whisper语音识别模型进行详细测试后发现,该模型对老年人的转录准确度实际上优于年轻人。[1]基于Common Voice 17英文数据集中的2,760个音频片段的分析显示,70多岁人群的词错率为4.67%,相比20多岁人群的6.53%降低了1.86个百分点。[1]

然而,研究同时揭示了端点检测环节存在的年龄偏差问题。[1]当采用700毫秒的固定沉默阈值进行语音断点判断时,年长者被系统过早中断的风险显著更高。[1]具体而言,60多岁人群的被打断率为19.7%,较20多岁的8.0%增加11.6个百分点;70多岁人群为16.6%,增加8.5个百分点;80多岁人群更是达到22.1%,相比20多岁的4.1%增长5.4倍。[1]这一现象的根本原因在于年长者的说话模式差异——他们平均每段话中包含2次停顿,总停顿时间约420-480毫秒,而20多岁人群仅有1次停顿,总时间240毫秒。[1]

研究进一步测试了改进方案的效果。[1]使用语义转折模型smart-turn v3后,60多岁和70多岁人群的打断率差距分别从+11.6个百分点和+8.5个百分点降至+5.9个百分点和+4.0个百分点,表明智能端点检测能显著缓解年龄相关的识别中断问题。[1]


Whisper语音识别年龄差异语音转录准确度Common Voice数据集语音端点检测