跳到正文
10月10日周六
  1. The Decoder60

    微软发布 Decision-1 决策模型,基于 Qwen3.5-9B

    微软发布决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,速度比第二名 H2O-Lightning-4B 快 2.5 倍;对比中未纳入同样基于 Qwen 的 Cloudflare 开源 Clef 模型。

10月9日周五
10月7日周三
10月6日周二
  1. Mistral AI80

    Mistral 发布 Mistral Large 4 公开预览,1 万亿参数原生多模态

    Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底开放。

    推荐理由:Mistral 官方给出 1 万亿参数多模态模型的公开预览、权重开放时间与自建欧洲算力背景,可据此判断开源权重阵营的竞争位置。

10月2日周五
7月29日周三
  1. Berkeley AI Research60

    从 CUDA 到 MLX:K-Search 如何把内核优化经验带到 Apple Silicon

    Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核迁移的方法与实测差距。

7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的递归摘要隔离为自然语言"信念状态"并对其内容进行监督评分。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research31

    GRASP:面向世界模型长时程规划的梯度规划器

    伯克利 AI 研究提出 GRASP,一种面向学习型世界模型的梯度规划器,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的“状态-输入”梯度。该方法针对长时程规划中计算图病态、非贪心结构导致局部极小值以及高维潜空间失效模式等问题,使基于梯度的规划更稳健。

3月13日周五
  1. Berkeley AI Research32

    伯克利提出 SPEX 与 ProxySPEX:大规模识别 LLM 关键交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。