跳到正文
10月11日周日
10月10日周六
  1. The Decoder60

    微软发布 Decision-1 决策模型,基于 Qwen3.5-9B

    微软发布决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,速度比第二名 H2O-Lightning-4B 快 2.5 倍;对比中未纳入同样基于 Qwen 的 Cloudflare 开源 Clef 模型。

  2. Latent Space42

    Standard Bots 如何为工业机器人构建可靠执行的 AI

    Standard Bots 用共享基础模型加客户演示微调的方式驱动机器人手臂,最大模型参数量在“low billions”级别,训练在云端、推理在本地边缘 GPU 上完成。其零样本感知系统基于超 10 亿张图像训练,负责定位识别零件,运动与单元逻辑仍由传统编程处理。公司称已获 NASA、Amazon、Lockheed Martin 等客户,近期以 10 亿美元估值完成 2 亿美元 C 轮融资。

10月9日周五
  1. Hugging Face Blog34

    Ai2 如何为 GPU 集群设计高影响力调度系统

    Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维协调变成透明的行政预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300 GPU,规模从 88 到 1024 块不等,服务约 150 名内部研究员,而待处理请求对 GPU 的需求常年是可用量的 2-3 倍。

10月8日周四
  1. MIT Technology Review · AI22

    AVEVA 如何为自主工业 AI 构建更安全的路径

    AVEVA 首席技术专家 Arti Garg 认为,工业 AI 走向自主化需以安全为前提,AI 应增强而非取代关键决策中的人类。她援引一项研究称工业领域 AI 采用率过去两年增长约 78%,AVEVA 的负责任 AI 框架强调安全、效率与人类监督。她参与的 IEEE 工作组正制定衡量 AI 在电力、能源、水与碳等方面环境影响的标准方法。

  2. NVIDIA Blog78

    NVIDIA 与微软发布 RTX Spark 笔记本和 Windows 版 DGX Station

    在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,微软同时宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统管控下安全持久地在后台运行。

    推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。

  3. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展推送保护

    GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用周围代码上下文识别数据库密码、Kubernetes Secret、Dockerfile 等无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 公开了九季度密钥泄露数据,并说明新分类器如何把推送拦截扩展到无固定格式的密钥。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:约 3500 行的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。

    推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。

10月7日周三
  1. AWS Machine Learning Blog22

    如何为 agentic automation 构建商业论证:超越节省工时

    AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架指出节省的工时未必转化为利润,价值实现还需明确机制与责任人;AWS 给出的规划区间显示,纠错成本可达原始交易的 1.5–4 倍,人为错误可占运营成本的 2–15%。

10月5日周一
10月2日周五
  1. NVIDIA Blog60

    NVIDIA 推出 DGX Spark 64GB,支持双机集群扩展本地 AI

    NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售 DGX Spark 64GB 版本,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。

    推荐理由:原文给出 64GB 版本的定价、上市时间和双机集群性能数据,读者可据此判断本地跑百亿参数智能体的成本与扩展方式。

10月1日周四
  1. Microsoft Research31

    微软研究院用机器学习预测电网空间天气风险

    微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。

9月28日周一
9月25日周五
9月24日周四
  1. GitHub Blog · AI & ML22

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框等动态块则按稳定 key 锚定到文件、行和侧,惰性测量并限制修正幅度。

  2. Microsoft Research62

    微软研究:把物理 AI 推理卸载到边缘或云端 GPU 可提升机器人表现与续航

    微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。

9月10日周四
  1. Mistral AI34

    Mistral 与 Cloudera 合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上运行着 30 exabytes 的客户管理数据。

9月9日周三
  1. Mistral AI50

    Mistral 如何用 AI 智能体现代化改造复杂遗留代码

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。Mistral 先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移。

8月20日周四
  1. Mistral AI71

    Mistral 发布 Agentic Search,用多步检索循环提升文档问答准确率

    Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在回答前查找、翻阅并核对证据,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。

    推荐理由:原文给出多步检索循环的工具设计与 FinanceBench、OfficeQA Pro 上的准确率与延迟变化,可对照传统 one-shot RAG 判断适用边界。

7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核迁移的方法与实测差距。

7月7日周二
5月8日周五