在本地跑 AI 模型是种什么体验:兴奋、不知所措与挫败
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
一位非 AI 专家在 M5 Ultra Mac Studio 上安装开源 Hermes Agent 并运行 125B 参数的 Qwen 3.8 Flash Next 模型,尝试本地 AI 智能体。他用它生成每日简报、整理 400 多款 Steam 游戏库、分析财务记录,但坦言面对文本框常不知该让它做什么,过程既兴奋又令人不知所措。
Standard Bots 用共享基础模型加客户演示微调的方式驱动机器人手臂,最大模型参数量在“low billions”级别,训练在云端、推理在本地边缘 GPU 上完成。其零样本感知系统基于超 10 亿张图像训练,负责定位识别零件,运动与单元逻辑仍由传统编程处理。公司称已获 NASA、Amazon、Lockheed Martin 等客户,近期以 10 亿美元估值完成 2 亿美元 C 轮融资。
Postman 在 Amazon Bedrock 上构建 Agent Mode,以 AI 原生方式覆盖 API 测试、文档、发现与实现,服务 4000 万开发者。
Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维协调变成透明的行政预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300 GPU,规模从 88 到 1024 块不等,服务约 150 名内部研究员,而待处理请求对 GPU 的需求常年是可用量的 2-3 倍。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里几乎全程靠说话为博客建成了 Newsletters 页面,由 GPT-6 Astra High 完成新模型、迁移、视图、模板和四个导入脚本。
开发者正用前沿 AI 模型(如 GPT-6 Astra、Claude Fable 5)配合 NVIDIA Omniverse 库,通过自然语言指令构建仿真应用。
AWS 发布基于 Amazon SageMaker HyperPod 与 EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
作者在 HuggingChat 中开启 ML-intern,用提示词描述需求,两天内做出六个模型并发布到 Hugging Face Hub,总计算花费约 103 美元。
推荐理由:作者用 ML-intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架指出节省的工时未必转化为利润,价值实现还需明确机制与责任人;AWS 给出的规划区间显示,纠错成本可达原始交易的 1.5–4 倍,人为错误可占运营成本的 2–15%。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式可用以来,其 Discovery Agent 已为客户发现超过 10 万条异常与离群点。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中提到 GitHub Copilot 内置的 Rubber Duck agent 会用第二个模型来审查计划、代码和测试,以捕捉首个模型遗漏的问题。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 技能并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需手写代码或设计布局。
GitHub Copilot 提出用 canvas 替代聊天框作为 AI 交互界面:canvas 是运行在 Copilot 应用内的全栈小应用,可与 agent 双向通信、调用第三方 API 并在本地执行代码。
GitHub Copilot 应用重建了 pull request 视图,以应对超大 diff 与评论带来的渲染压力,实测对象是一个含 2,200 个文件、超 100 万行改动、400 多条行内评论的开源 pull request。方案将文档高度拆成确定性的代码几何与动态块几何两部分:代码行高可提前精确计算,评论、草稿和回复框等动态块则按稳定 key 锚定到文件、行和侧,惰性测量并限制修正幅度。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移至 C++,对象是一个无测试套件、无集中文档的物理密集型油藏模拟器。Mistral 先构建数值一致性校验框架,再用 Vibe CLI 调度上百个智能体解析调用树并生成文档,最终采用人类操作 coder、tester、reviewer 智能体工作流逐模块迁移。