跳到正文
10月9日周五
10月8日周四
  1. Google Research64

    Google Research 研究:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。

  2. AWS Machine Learning Blog65

    AWS 上线 Claude Haiku 5.5,成本较 Haiku 4.5 降低约 75%

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍,它是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与接入方式,可据此判断它在多智能体分工中的成本位置。

  3. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。

    推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。

10月7日周三
  1. AWS Machine Learning Blog22

    如何为 agentic automation 构建商业论证:超越节省工时

    AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架指出节省的工时未必转化为利润,价值实现还需明确机制与责任人;AWS 给出的规划区间显示,纠错成本可达原始交易的 1.5–4 倍,人为错误可占运营成本的 2–15%。

  2. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测的意外失败与数据洞察

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。

10月6日周二
  1. Mistral AI80

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底开放。

    推荐理由:Mistral 官方给出 1 万亿参数多模态模型的公开预览、权重开放时间与自建欧洲算力背景,可据此判断开源权重阵营的竞争位置。

10月5日周一
10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业的 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。

10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Gemini 4 Argon 给出 1M 输出 token、DeepSWE 77.9% 与网络安全防御能力,可据此判断前沿模型在长周期工程任务上的进展。

9月26日周六
9月25日周五
  1. Google Research62

    Google Research 发布 AI 视频联合导演框架,自动化生成连贯长视频

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排层,把长视频生成当作全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体编排如何缓解跨镜头漂移与错误累积。

  2. GitHub Blog · AI & ML60

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub 仓库地址,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 已死、Skills 杀死了 MCP?

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的相关信息,减少 token 浪费并让回答更有依据。

9月16日周三
9月9日周三
  1. Mistral AI50

    Mistral 如何用 AI 智能体现代化改造复杂遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。Mistral 先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,用多步检索循环提升文档问答准确率

    Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在回答前查找、翻阅并核对证据,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环的工具设计与 FinanceBench、OfficeQA Pro 上的准确率与延迟变化,可对照传统 one-shot RAG 判断适用边界。

7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。

7月7日周二