跳到正文
10月7日周三
  1. Hugging Face Blog47

    TII 推出 Falcon-ASR:1.6B 阿拉伯语语音识别模型,主打阿联酋方言

    阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。

  2. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测的意外失败与数据洞察

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业的 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。

9月30日周三
8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,用多步检索循环提升文档问答准确率

    Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在回答前查找、翻阅并核对证据,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环的工具设计与 FinanceBench、OfficeQA Pro 上的准确率与延迟变化,可对照传统 one-shot RAG 判断适用边界。