PolyAI 与 Otter 高管:语音 AI 尚未迎来自己的 ChatGPT 时刻
PolyAI CTO Shawn Wen 与 Otter CMO Alex Gay 认为,语音 AI 虽已实现全双工模型,但尚未迎来"ChatGPT 时刻",下一步挑战是让推理足够快、对话自然。Wen 指出 ASR 模型常漏掉关键词导致上下文丢失,Gay 强调转写准确率是所有下游功能的基础。Otter 还在研发可代表用户参会的数字分身,并推动录音与 AI 身份告知等透明度措施。
PolyAI CTO Shawn Wen 与 Otter CMO Alex Gay 认为,语音 AI 虽已实现全双工模型,但尚未迎来"ChatGPT 时刻",下一步挑战是让推理足够快、对话自然。Wen 指出 ASR 模型常漏掉关键词导致上下文丢失,Gay 强调转写准确率是所有下游功能的基础。Otter 还在研发可代表用户参会的数字分身,并推动录音与 AI 身份告知等透明度措施。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测从数周投票缩短到数小时。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,让对话具备会听、会看、会说的动态视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言口型同步与后台工具调用如何用于企业对话场景。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高吞吐、低成本的配音与语音智能体场景。
推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:两款语音对话模型同时发布,给出了语音智能体基准成绩和开发者接入渠道,可据此判断实时语音 Agent 的可用性。