跳到正文
今天10月12日周一3 条
  1. TechCrunch · AI22

    Amazon 放弃数据中心保密协议,AI 智能体想要你的信用卡

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反对已导致从纽约到旧金山数百项拟议和已颁布的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。

  2. TechCrunch · AI22

    Amazon 等公司不再对数据中心交易保密,这足以建立信任吗?

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密曾加剧社区对 AI 基础设施的反对,从纽约到旧金山已出现数百项拟议和已颁布的禁令。TechCrunch Equity 播客还讨论了个人 AI 初创公司为何可能把信任当作真正的产品。

10月11日周日
  1. TechCrunch · AI22

    PolyAI 与 Otter 高管:语音 AI 尚未迎来自己的 ChatGPT 时刻

    PolyAI CTO Shawn Wen 与 Otter CMO Alex Gay 认为,语音 AI 虽已实现全双工模型,但尚未迎来"ChatGPT 时刻",下一步挑战是让推理足够快、对话自然。Wen 指出 ASR 模型常漏掉关键词导致上下文丢失,Gay 强调转写准确率是所有下游功能的基础。Otter 还在研发可代表用户参会的数字分身,并推动录音与 AI 身份告知等透明度措施。

  2. The Decoder71

    Epoch AI 研究:AI 智能体夸大研究结果,远未实现自主科研

    Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。

10月10日周六
  1. The Verge · AI36

    AI 智能体厂商竞相承诺隐私保护,OpenAI Dots 与 Meta Muse 谁能兑现?

    OpenAI 在 DevDay 发布 AI 智能体 Dots,承诺为前沿 AI 隐私设定新标准,并推出零数据保留政策选项,但 Dots 目前仅面向 $100 及以上的 ChatGPT 订阅档位。Meta 的 Muse 此前以隐私安全为卖点,上线数周内在美国获得 60 万日活用户,却被曝出 Meta 自身仍可访问用户数据、存在零日漏洞,且默认允许用用户数据训练模型。

10月9日周五
10月8日周四
  1. Google Research64

    Google Research 研究:AI 辅助提升专利撰写产出,但未加速初级律师判断力成长

    Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。

    推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。

  2. AWS Machine Learning Blog65

    AWS 上线 Claude Haiku 5.5,成本较 Haiku 4.5 降低约 75%

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍,它是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与接入方式,可据此判断它在多智能体分工中的成本位置。

  3. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。

    推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。

10月7日周三
  1. AWS Machine Learning Blog22

    如何为 agentic automation 构建商业论证:超越节省工时

    AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架指出节省的工时未必转化为利润,价值实现还需明确机制与责任人;AWS 给出的规划区间显示,纠错成本可达原始交易的 1.5–4 倍,人为错误可占运营成本的 2–15%。

  2. Microsoft Research22

    Microsoft 研究员 Jennifer Neville 谈 AI 评测的意外失败与数据洞察

    Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。

10月6日周二
  1. Mistral AI80

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底开放。

    推荐理由:Mistral 官方给出 1 万亿参数多模态模型的公开预览、权重开放时间与自建欧洲算力背景,可据此判断开源权重阵营的竞争位置。

10月5日周一
  1. MIT Technology Review · AI27

    连接 AI 智能体与企业知识

    对 300 位技术高管的调研显示,企业平均仅约 34% 的智能体项目进入生产,知识缺失是主要失败原因之一。生产领先者(平均 61% 的项目走出试点)知识能力更强;55% 的受访者将数据碎片化列为扩大智能体知识访问的首要挑战。组织计划优先投资数据摄取管道、AI-ready API 与 RAG 等

10月4日周日
  1. Hugging Face Blog71

    微软与 Hugging Face 发布 ThinkingBox:按数据库终态给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业的 AI 智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。

10月1日周四
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:Gemini 4 Argon 给出 1M 输出 token、DeepSWE 77.9% 与网络安全防御能力,可据此判断前沿模型在长周期工程任务上的进展。

9月28日周一
9月26日周六
9月25日周五
  1. Google Research62

    Google Research 发布 AI 视频联合导演框架,自动化生成连贯长视频

    Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排层,把长视频生成当作全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。

    推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体编排如何缓解跨镜头漂移与错误累积。

  2. GitHub Blog · AI & ML60

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub 仓库地址,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。