Amazon Bedrock、AgentCore 与 Strands 9 月更新盘点:GPT-6 Astra、Claude Opus 5.5、Kimi K3 等上线
Amazon Bedrock 9 月新增 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最多 100 万输入 token,Ultrafast 版本 API 推理最高快 6 倍、达 300 tokens/秒。
Amazon Bedrock 9 月新增 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最多 100 万输入 token,Ultrafast 版本 API 推理最高快 6 倍、达 300 tokens/秒。
开发者正用前沿 AI 模型(如 GPT-6 Astra、Claude Fable 5)配合 NVIDIA Omniverse 库,通过自然语言指令构建仿真应用。
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验性)。d1-3B 在 Decision Index 0.2.1 上得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B 的 47.11,支持文本与图像,在 NVIDIA Jetson AGX Thor 上单次回答耗时 16 ms。
推荐理由:Liquid AI 公开两款决策模型及端侧与 GPU 实测延迟,可据此判断单次前向决策在边缘设备上的可用性。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。
英伟达团队从 Nemotron 3 出发,用监督微调、强化学习和反馈驱动的推理流程,在 IOI 2026 与 IMO 2026 两个竞赛中达到金牌水平。
推荐理由:原文公开了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方,包括数据规模与推理流程。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
Google DeepMind 推出 SynthID Bio,把水印技术带入合成生物学,将不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印技术延伸到合成生物学,读者可了解 AI 生成蛋白质如何被标记与验证,以及它对 DNA 合成筛查的意义。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。
微软研究院在 Nature 发表逆合成模型 RetroChimera,融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成与重排序提升预测质量,并已开源实现与权重。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,将病理基础模型的计算需求大幅降低。GigaPath-Flash 采用 22M 参数的 ViT-S tile 编码器和 21M 参数的 LongNet slide 编码器,在 PANDA 和 EBRAINS 基准上以约 50 倍更少算力达到原版 GigaPath 3% 以内的性能。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核迁移的方法与实测差距。
伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动模型输出的关键交互。SPEX 利用稀疏性与低阶性将交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统信息量,无需任务专用解码器。该信息指标在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能,优化后的设计达到 SOTA 端到端方法水平,同时占用更少内存和算力。相关论文发表于 NeurIPS 2025。