GitHub 发布 ReviewBench:面向 AI 代码审查的开放基准
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。