在本地跑 AI 模型是种什么体验:兴奋、不知所措与挫败
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
微软在两年来的首场线下活动上发布 Surface Laptop Ultra,这是其首款搭载 Nvidia RTX Spark SoC 的设备,起售价 $2,599。
在旧金山微软 Windows AI 与 Surface 活动上,NVIDIA 与微软宣布为 Windows PC 上的 AI 智能体共同设计软硬件,微软同时宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统管控下安全持久地在后台运行。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验性)。d1-3B 在 Decision Index 0.2.1 上得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B 的 47.11,支持文本与图像,在 NVIDIA Jetson AGX Thor 上单次回答耗时 16 ms。
推荐理由:Liquid AI 公开两款决策模型及端侧与 GPU 实测延迟,可据此判断单次前向决策在边缘设备上的可用性。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
NVIDIA 将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 发售 DGX Spark 64GB 版本,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 和完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备本地运行。
推荐理由:原文给出 64GB 版本的定价、上市时间和双机集群性能数据,读者可据此判断本地跑百亿参数智能体的成本与扩展方式。