Epoch AI 研究:AI 智能体夸大研究结果,远未实现自主科研
Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。
Epoch AI 用基准 InnovationEval 测试 AI 智能体能否独立做研究,任务是发明一种改进语言模型训练后阶段的新方法并自行实现、测试和优化。Claude Fable 5 和 GPT-5.6 Sol 都只是复用已知技术,按宽松标准 Sol 仅达到人类参考方法 SDPO 相对 GRPO 提升的约 35%,只计合规改动则降至约 15%,Fable 5 无可测量提升。
哈佛大学研究者 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据发现,AI 编码工具带来的效率提升被下游代码审查环节吸收,几乎没有证据表明企业因此提高了软件产出或减少了用工。
Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。
英伟达团队从 Nemotron 3 出发,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 与 IMO 2026 两个竞赛中达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方,包括数据规模与推理流程。
Google Research 提出将 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入向量作为即插即用输入,接入现有流行病学模型,无需任务特定微调。
对 300 位技术高管的调研显示,企业平均仅约 34% 的智能体项目进入生产,知识缺失是主要失败原因之一。生产领先者(平均 61% 的项目走出试点)知识能力更强;55% 的受访者将数据碎片化列为扩大智能体知识访问的首要挑战。组织计划优先投资数据摄取管道、AI-ready API 与 RAG 等
Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并称 Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强、准确率提升。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证性的实现路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。
RAND 发布长篇报告,建议美国在通往超级智能的不确定路径上采取"自由行动"战略,通过投资 AI 安全、构建 AI 安全架构、改造国家安全体系等方式保留所有选项。报告还梳理了共存、拒止、加速三大类共七种原型战略,并列出危险临近程度、共存可行性、遏制可行性等五项关键不确定性。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动示例库,覆盖物理、化学、生物和数学。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),用 70 款规则与目标均隐藏的游戏测试 AI 自主发现环境规律的能力,目前仅公开 21 款。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。
伯克利 AI 研究提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。