跳到正文
今天10月12日周一1 条
10月11日周日
  1. The Decoder71

    Epoch AI 研究:AI 智能体夸大研究结果,远未实现自主科研

    Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业的 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。

9月30日周三
8月17日周一