Ai2 如何为 GPU 集群设计高影响力调度系统
Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维协调变成透明的行政预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300 GPU,规模从 88 到 1024 块不等,服务约 150 名内部研究员,而待处理请求对 GPU 的需求常年是可用量的 2-3 倍。
Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维协调变成透明的行政预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300 GPU,规模从 88 到 1024 块不等,服务约 150 名内部研究员,而待处理请求对 GPU 的需求常年是可用量的 2-3 倍。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
作者在 HuggingChat 中开启 ML-intern,用提示词描述需求,两天内做出六个模型并发布到 Hugging Face Hub,总计算花费约 103 美元。
推荐理由:作者用 ML-intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。
英伟达团队从 Nemotron 3 出发,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 与 IMO 2026 两个竞赛中达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方,包括数据规模与推理流程。
Google Research 提出将 Google Earth AI 的 Population Dynamics Foundation Model(PDFM)位置嵌入向量作为即插即用输入,接入现有流行病学模型,无需任务特定微调。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
NVIDIA Inception 计划中的三家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,其 AI 基于超 150 万帧超声图像训练,灵敏度比手持 2D 超声高 28%。
Google Research 公布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可远程验证和审计的保证,并称 Gboard 已采用该系统上线英语和日语下一词预测模型,隐私保证更强、准确率提升。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证性的实现路径。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功轨迹定位能力缺口,再生成并验证新的可执行任务用于后训练,课程随模型改进向仍难的任务迁移。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项要求,验证器则要求一致性、可靠性和完备性。该流程在 EnterpriseOps Gym 环境中演示,并使用了已发布的数据集。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,将不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印技术延伸到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证,以及它对 DNA 合成筛查的意义。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式编排框架组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
微软研究院亚洲–新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动学习模拟,并同步开放 30 多个面向中学 STEM 的英文学习互动示例库,覆盖物理、化学、生物和数学。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 倍以上,已通过网站门户、AlphaGenome API 和 Google Antigravity 中的 skill 开放学术研究使用。
推荐理由:原文给出了覆盖 90 亿个单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解变异影响排序的新入口。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,将病理基础模型的计算需求大幅降低。GigaPath-Flash 采用 22M 参数的 ViT-S tile 编码器和 21M 参数的 LongNet slide 编码器,在 PANDA 和 EBRAINS 基准上以约 50 倍更少算力达到原版 GigaPath 3% 以内的性能。
Mistral 与 HUMAIN 宣布达成战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三类新挑战:为智能体设计的数据系统、支撑智能体集群的数据系统、以及由智能体合成的数据系统。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生名单,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for science 等方向。毕业生去向包括 Physical Intelligence、OpenAI、Mistral AI、Amazon 等机构,以及 UCLA、芝加哥大学教职和自主创业。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild!
伯克利 AI 研究提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。