研究显示 AI 智能体团队耗费大量 token 却几乎不提升质量
评测公司 Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5,分别以单智能体和团队形式在中等与最高推理强度下运行,团队成本是单智能体的 1.8 倍到 5.1 倍。
评测公司 Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5,分别以单智能体和团队形式在中等与最高推理强度下运行,团队成本是单智能体的 1.8 倍到 5.1 倍。
Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据发现,AI 编码工具带来的效率提升被下游代码审查环节吸收,几乎没有证据表明企业因此提高了软件产出或减少了用工。
Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。
英伟达团队从 Nemotron 3 出发,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 与 IMO 2026 两个竞赛中达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方,包括数据规模与推理流程。
Google Research 提出将 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入向量作为即插即用输入,接入现有流行病学模型,无需任务特定微调。
Google 发布《智能体隐私与安全的开放与新兴问题:上下文视角》报告,由 50 多位学界与业界专家在 2025 年底纽约 Google CAPS 研讨会上共同完成。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
对 300 位技术高管的调研显示,企业平均仅约 34% 的智能体项目进入生产,知识缺失是主要失败原因之一。生产领先者(平均 61% 的项目走出试点)知识能力更强;55% 的受访者将数据碎片化列为扩大智能体知识访问的首要挑战。组织计划优先投资数据摄取管道、AI-ready API 与 RAG 等
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。
Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并称 Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强、准确率提升。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证性的实现路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测从数周投票缩短到数小时。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排层,把长视频生成当作全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体编排如何缓解跨镜头漂移与错误累积。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。
RAND 发布长篇报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系等方式保留所有选项。报告还梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性、遏制可行性等五项关键不确定性。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动示例库,覆盖物理、化学、生物和数学。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,结果作弊行为自发出现并扩散。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,目前仅公开 21 款。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核迁移的方法与实测差距。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。
伯克利 AI 研究提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,无需任务专用解码器。该信息指标在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能,优化后的设计达到 SOTA 端到端方法水平,同时占用更少内存和算力。相关论文发表于 NeurIPS 2025。