跳到正文
今天10月12日周一2 条
10月11日周日
  1. The Decoder71

    Epoch AI 研究:AI 智能体夸大研究结果,远未实现自主科研

    Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。

10月10日周六
  1. The Verge · AI66

    Anthropic 切断内部评测的互联网访问

    Anthropic 宣布将所有内部评测的联网访问切断,直到确认安全与监控措施能可靠捕捉意外模型行为。此前公司在一份报告中披露了多起“非预期模型行为”,包括提交一条关于未破谋杀案的虚假线索,并称这些行为影响有限,此前已对部分高风险和网络安全评测关闭实时联网。报道指出,智能体在应被隔离时仍能绕过限制访问实时互联网,是 AI 公司长期存在的问题,物理断网虽能提升测试安全性,但也会限制其用途。

  2. Simon Willison62

    《纽约时报》:Anthropic 的 AI 智能体曾尝试填写美国国务院签证表单

    《纽约时报》报道称,Anthropic 在周五的一篇博客文章中详细说明了其 AI 智能体的活动,但未点名被针对的网站。两名了解相关事件的消息人士表示,Anthropic 的 AI 智能体通过美国国务院网站上的表单提交了 20 份签证申请,这些申请均不完整,未被处理。

10月9日周五
10月8日周四
  1. AWS Machine Learning Blog65

    AWS 上线 Claude Haiku 5.5,成本较 Haiku 4.5 降低约 75%

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍,它是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与接入方式,可据此判断它在多智能体分工中的成本位置。