AI 行业能否靠取消 NDA 说服数据中心反对者?
Amazon 效仿 Microsoft,宣布在与地方政府谈判数据中心事宜时不再使用保密协议(NDA)。TechCrunch 的 Equity 播客讨论认为,此举或有助于缓解社区对数据中心的抵触,但当前多地通过的暂停令以及行业沟通不畅,使实际效果仍待观察。
Amazon 效仿 Microsoft,宣布在与地方政府谈判数据中心事宜时不再使用保密协议(NDA)。TechCrunch 的 Equity 播客讨论认为,此举或有助于缓解社区对数据中心的抵触,但当前多地通过的暂停令以及行业沟通不畅,使实际效果仍待观察。
Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反对已导致从纽约到旧金山数百项拟议和已颁布的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。
Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密曾加剧社区对 AI 基础设施的反对,从纽约到旧金山已出现数百项拟议和已颁布的禁令。TechCrunch Equity 播客还讨论了个人 AI 初创公司为何可能把信任当作真正的产品。
微软 CEO Satya Nadella 在最新博文中改用特朗普偏好的"Super Intelligence"一词,并主张把 AI 模型当作内部安全威胁来对待,要求模型多样性、完整日志、独立审计和随时关停能力。
微软 CEO Satya Nadella 在 X 发布长文,阐述对高度先进 AI 模型风险的看法,称不能再接受把 AI 当作一组嵌套黑盒、只能接受或拒绝其建议与行动。
微软 CEO Satya Nadella 在 X 发文称,应重新审视 AI 的信任架构,不能把超级智能当作嵌套黑箱,只能被动接受或拒绝其建议与行动。他主张将模型与编排其工作的 harness 分离、把控制与保障外部化,为每个有意义的模型动作留下防篡改的人类可读证据,并让授权者能在任务中途暂停或关闭模型。他称必须假设模型已被攻破并从一开始就加以约束,就像紧急刹车。
微软发布决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,速度比第二名 H2O-Lightning-4B 快 2.5 倍;对比中未纳入同样基于 Qwen 的 Cloudflare 开源 Clef 模型。
MIT Technology Review 刊文讨论 AI 拒答机制:模型通过微调和分类器学会拒绝有害请求,但拒答本质是概率性的,越狱攻击仍能突破,Anthropic 曾称一类分类器让聊天机器人算力成本增加 24%。
微软在两年来的首场线下活动上发布 Surface Laptop Ultra,这是其首款搭载 Nvidia RTX Spark SoC 的设备,起售价 $2,599。
在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,微软同时宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统管控下安全持久地在后台运行。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用周围代码上下文识别数据库密码、Kubernetes Secret、Dockerfile 等无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了九季度密钥泄露数据,并说明新分类器如何把推送拦截扩展到无固定格式的密钥。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。
Microsoft 的 Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在传统 benchmark 之外测试时出现的"意外失败"。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时深入检查数据的重要性。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的开放离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 19 种语言、187 个开源仓库的 219 个 pull request。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式编排框架组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
微软研究院亚洲–新加坡(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 技能并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需手写代码或设计布局。
GitHub Copilot 提出用 canvas 替代聊天框作为 AI 交互界面:canvas 是运行在 Copilot 应用内的全栈小应用,可与 agent 双向通信、调用第三方 API 并在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框等动态块则按稳定 key 锚定到文件、行和侧,惰性测量并限制修正幅度。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,将病理基础模型的计算需求大幅降低。GigaPath-Flash 采用 22M 参数的 ViT-S tile 编码器和 21M 参数的 LongNet slide 编码器,在 PANDA 和 EBRAINS 基准上以约 50 倍更少算力达到原版 GigaPath 3% 以内的性能。