Folia
← 返回头版

Whistle:16.9 MB语音识别模型发布

Cactus Compute团队发布了Whistle语音识别模型,文件体积仅为16.9 MB,可在CPU上运行且无任何依赖1。该模型支持转录、词级时间戳和语音嵌入三项核心功能,覆盖英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语七种语言1。

Whistle在多项基准测试中的性能超越OpenAI的Whisper base模型,同时提供更快的处理速度和显著更小的体积——相比Whisper base的145.3 MB,体积缩小至16.9 MB1。在处理延迟方面,该模型处理5秒音频时首词延迟为5.9毫秒,处理30秒音频时为36.3毫秒1。

该模型已支持17个目标平台的部署,包括macOS、Linux、Android、iOS、watchOS、Windows on ARM、RISC-V、MIPS、浏览器以及WASI组件1。开发团队通过比对音频校验和与说话人ID确保评估所用的86,174个语句未出现在模型的训练或验证数据中1。


评论