跳到正文
10月11日周日
  1. TechCrunch · AI22

    PolyAI 与 Otter 高管:语音 AI 尚未迎来自己的 ChatGPT 时刻

    PolyAI CTO Shawn Wen 与 Otter CMO Alex Gay 认为,语音 AI 虽已实现全双工模型,但尚未迎来"ChatGPT 时刻",下一步挑战是让推理足够快、对话自然。Wen 指出 ASR 模型常漏掉关键词导致上下文丢失,Gay 强调转写准确率是所有下游功能的基础。Otter 还在研发可代表用户参会的数字分身,并推动录音与 AI 身份告知等透明度措施。

10月7日周三
  1. Hugging Face Blog47

    TII 推出 Falcon-ASR:1.6B 阿拉伯语语音识别模型,主打阿联酋方言

    阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。

9月30日周三
9月25日周五
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,让对话具备会听、会看、会说的动态视觉形象。

    推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言口型同步与后台工具调用如何用于企业对话场景。

9月23日周三
  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐句表演指导,后者面向高吞吐、低成本的配音与语音智能体场景。

    推荐理由:两款 TTS 模型把语音生成从固定音色扩展到自然语言定制与逐句导演,并给出基准排名和开放入口。

9月16日周三