在本地跑 AI 模型是种什么体验:兴奋、不知所措与挫败
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
Python 3.15.0 已被加入 actions/python-versions,现在可以在 GitHub Actions 测试矩阵中写入 "3.15" 来对新版 Python 3.15.0 运行测试。Simon Willison 称已为此等待数日,甚至让 ChatGPT 每小时检查一次该版本是否上线。
微软发布决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,速度比第二名 H2O-Lightning-4B 快 2.5 倍;对比中未纳入同样基于 Qwen 的 Cloudflare 开源 Clef 模型。
Standard Bots 用共享基础模型加客户演示微调的方式驱动机器人手臂,最大模型参数量在“low billions”级别,训练在云端、推理在本地边缘 GPU 上完成。其零样本感知系统基于超 10 亿张图像训练,负责定位识别零件,运动与单元逻辑仍由传统编程处理。公司称已获 NASA、Amazon、Lockheed Martin 等客户,近期以 10 亿美元估值完成 2 亿美元 C 轮融资。
Amazon Bedrock 9 月新增 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 GPT-6 Astra 支持最多 100 万输入 token,Ultrafast 版本 API 推理最高快 6 倍、达 300 tokens/秒。
Postman 在 Amazon Bedrock 上构建 Agent Mode,以 AI 原生方式覆盖 API 测试、文档、发现与实现,服务 4000 万开发者。
Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维协调变成透明的行政预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300 GPU,规模从 88 到 1024 块不等,服务约 150 名内部研究员,而待处理请求对 GPU 的需求常年是可用量的 2-3 倍。
Asana 借助 Codex 中的 GPT-6 Astra,在浏览器测试中让浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
Simon Willison 的 token 计数 CLI 工具 ttok 更新至 0.4,修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型。该工具基于 OpenAI 开源的 tiktoken 库,支持通过 uvx 直接运行,例如 `cat file.txt | uvx ttok`。
开发者正用前沿 AI 模型(如 GPT-6 Astra、Claude Fable 5)配合 NVIDIA Omniverse 库,通过自然语言指令构建仿真应用。
Amazon Bedrock AgentCore payments 正式可用,为 AI 智能体提供按需付费的托管能力,在基础设施层而非模型层执行消费限额。Incarna 用它让智能体通过 x402 向 BlockRun 按次支付模型推理费用,集成从原计划的 2 到 3 个月缩短到 3 天,约 200 行应用代码。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
Oracle 在招聘、工程和运营环节借助 ChatGPT Work 与 Codex,把专家知识转化为快速、可重复的工作流,将原本数天的工作缩短到几分钟。
《Gears of War: E-Day》已于 10 月 6 日全球发售后上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能在云端体验,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna 模型,并对预算进行策略性管理。
AVEVA 首席技术专家 Arti Garg 认为,工业 AI 走向自主化需以安全为前提,AI 应增强而非取代关键决策中的人类。她援引一项研究称工业领域 AI 采用率过去两年增长约 78%,AVEVA 的负责任 AI 框架强调安全、效率与人类监督。她参与的 IEEE 工作组正制定衡量 AI 在电力、能源、水与碳等方面环境影响的标准方法。
在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,微软同时宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统管控下安全持久地在后台运行。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布基于 ModernBERT 的通用密钥检测分类器,用周围代码上下文识别数据库密码、Kubernetes Secret、Dockerfile 等无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了九季度密钥泄露数据,并说明新分类器如何把推送拦截扩展到无固定格式的密钥。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架指出节省的工时未必转化为利润,价值实现还需明确机制与责任人;AWS 给出的规划区间显示,纠错成本可达原始交易的 1.5–4 倍,人为错误可占运营成本的 2–15%。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万条异常与离群点。
Latent Space 采访了 Kubernetes 创始人 Craig McLuckie 和 Joe Beda,他们正通过 Stacklok 把编码智能体从桌面搬到云端。
NVIDIA Inception 计划中的三家初创公司正用 AI 补齐乳腺癌诊疗缺口:iSono Health 的 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,其 AI 基于超 150 万帧超声图像训练,灵敏度比手持 2D 超声高 28%。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售 DGX Spark 64GB 版本,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 版本的定价、上市时间和双机集群性能数据,读者可据此判断本地跑百亿参数智能体的成本与扩展方式。
OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。
推荐理由:原文给出 Astra Ultrafast 相对标准模式的提速幅度与开放入口,读者可据此判断它对编码智能体循环的实际影响。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测数据预测 AE 和 Dst 指数,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的空间天气风险估计。在 2020-2026 年评估期内,该系统检测到近 80% 的重大空间天气事件,Dst 预测在 62.2% 的峰值活动小时上优于 Burton 方程,严重事件检测率提升 1.2 个百分点。
Mistral 在慕尼黑开设新中心,组建专注 Physics AI 与工业 AI 的研究团队,并配备直接服务企业客户的应用工程师。Mistral 表示将在 2030 年前建成 1GW 欧洲算力容量,其开放权重模型可运行在客户自有基础设施上,数据不出组织。
Michael Levin 提出“柏拉图心智空间”假说,认为心智与大脑的关系如同数学模式与其引导的形态发生结果,身体(生物、工程或混合)只是高阶模式进入物理世界的接口。智谱启动了一个外层 RSI 循环,TPU 则被送入太空。
GitHub Copilot 提出用 canvas 替代聊天框作为 AI 交互界面:canvas 是运行在 Copilot 应用内的全栈小应用,可与 agent 双向通信、调用第三方 API 并在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框等动态块则按稳定 key 锚定到文件、行和侧,惰性测量并限制修正幅度。
微软研究院对移动机器人操作负载做了系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端 GPU 在任务成功率、时延和续航上的量化差异。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练自有模型,基于开放权重拥有数据和由此产生的智能。Cloudera 平台上运行着 30 exabytes 的客户管理数据。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。Mistral 先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移。
Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在回答前查找、翻阅并核对证据,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与 FinanceBench、OfficeQA Pro 上的准确率与延迟变化,可对照传统 one-shot RAG 判断适用边界。
Berkeley AI Research 与 IBM Research 将进化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA-to-MLX 翻译层,让已有 CUDA 内核成为知识库并适配为 Apple Silicon 内核。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核迁移的方法与实测差距。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三类新挑战:为智能体设计的数据系统、支撑智能体集群的数据系统、以及由智能体合成的数据系统。
伯克利 AI 研究团队梳理了并行推理领域进展,重点分析自适应并行推理——让模型自行决定何时分解并并行化独立子任务、生成多少并发线程以及如何协调。现有方法如 self-consistency、Best-of-N、Tree/Graph of Thoughts、MCTS 及 ParaThinker、GroupThink、Hogwild!