语音识别

科技人工智能

SpaceX AI发布Grok Voice Transcribe 2.0,准确度翻倍价格不变

SpaceX AI推出了语音识别模型Grok Voice Transcribe 2.0,相比前代版本实现了准确度的显著提升。新版本的准确度达到1.0版本的两倍,但定价保持一致,批量转录保持在0.10美元/小时,流式转录为0.20美元/小时。

科技人工智能

Canto:为现实世界打造的语音模型

Wispr Advanced Interfaces Lab推出了Canto语音模型,专门面向实际听写应用场景设计。该模型在由2,300多名独特说话者组成、包含10小时英语听写数据的真实评估集上实现了最低的词错率(WER),超越Google、OpenAI、AssemblyAI和Deepgram等竞争对手的模型。在3小时…

科技人工智能

Google 发布 Gemini 3.5 Transcribe 语音转文字模型

Google 发布了 Gemini 3.5 Transcribe 语音转文字模型,官方称其为最精确的语音识别模型,可将原始音频直接转换为准确且格式化的文本 。开发者可通过 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 使用该模型 。该…