作者用 ML-intern 两天做出六个模型,总花费约 103 美元
作者在 HuggingChat 中开启 ML-intern,用提示词描述需求,两天内做出六个模型并发布到 Hugging Face Hub,总计算花费约 103 美元。
推荐理由:作者用 ML-intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
作者在 HuggingChat 中开启 ML-intern,用提示词描述需求,两天内做出六个模型并发布到 Hugging Face Hub,总计算花费约 103 美元。
推荐理由:作者用 ML-intern 在两天内做出六个模型,并公开全部提示词与成本明细,可迁移到自己的训练流程。
Google Research 在 NBER 发表三个月实地实验,将当时未发布的 Google Labs AI 专利撰写助手(现属 Gemini Notebook)随机开放给 11 家律所的 133 名律师。
推荐理由:三个月专利撰写实验区分了AI辅助产出与无辅助判断,读者可据此理解AI对初级与资深从业者技能积累的不同影响。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍,它是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发、成本敏感任务,多数任务成本比 Claude Haiku 4.5 低约 75%。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的能力定位与接入方式,可据此判断它在多智能体分工中的成本位置。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与 RL 训练,无需在训练框架内重新实现 agent。
推荐理由:原文给出框架的代码规模、Kubernetes 支持与 SWE-bench Verified 提升数据,可据此判断真实 harness 参与 RL 训练的落地成本。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的公开预览、权重开放时间与自建欧洲算力背景,可据此判断开源权重阵营的竞争位置。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,再根据其留下的后端终态和副作用打分,而非依据模型生成的文字。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非模型自述来判定任务成败,并给出 507 个任务重复 20 次的稳定性数据。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:Gemini 4 Argon 给出 1M 输出 token、DeepSWE 77.9% 与网络安全防御能力,可据此判断前沿模型在长周期工程任务上的进展。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排层,把长视频生成当作全局优化与世界状态跟踪问题,以缓解语义漂移和级联失败。
推荐理由:Google 把长视频生成拆成四个可组合框架,读者可了解多智能体编排如何缓解跨镜头漂移与错误累积。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需传入 GitHub 仓库地址,智能体就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可据此判断自动化安全测试的边界。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:两款语音对话模型同时发布,给出了语音智能体基准成绩和开发者接入渠道,可据此判断实时语音 Agent 的可用性。
Mistral 发布 Agentic Search,一种面向企业复杂文档的多步检索层,通过 search、open、navigate、read、grep 五个工具让模型在回答前查找、翻阅并核对证据,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与 FinanceBench、OfficeQA Pro 上的准确率与延迟变化,可对照传统 one-shot RAG 判断适用边界。
从一批信源里筛出值得看的动态,同一件事的多篇报道归到一起,每天出一份日报

每个都有独立入口、介绍与获取方式

121 篇文章 · 80 个资源包 · 11 个分类

按公司与模型、技术方向、内容形态追踪同一条线索

每日精编、每周回顾、每月盘点,可订阅 RSS

多上游统一入口、密钥分发、用量与计费控制台
我们在持续补充新的板块。这里会放上还没准备好的部分,敬请期待。