Odyssey 开放世界模型 Odyssey-3 免费研究预览
Odyssey 面向公众开放世界模型 Odyssey-3 的研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,支持第一人称与第三人称视角;基础模型 14B 参数、生成 832 × 480 视频,Pro 版支持 1280 × 720。
Odyssey 面向公众开放世界模型 Odyssey-3 的研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,支持第一人称与第三人称视角;基础模型 14B 参数、生成 832 × 480 视频,Pro 版支持 1280 × 720。
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验性)。d1-3B 在 Decision Index 0.2.1 上得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B 的 47.11,支持文本与图像,在 NVIDIA Jetson AGX Thor 上单次回答耗时 16 ms。
推荐理由:Liquid AI 公开两款决策模型及端侧与 GPU 实测延迟,可据此判断单次前向决策在边缘设备上的可用性。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、520 亿激活参数的原生多模态模型,可在 Mistral Studio 试用预览 API,权重将于本月底开放。
推荐理由:Mistral 官方给出 1 万亿参数多模态模型的公开预览、权重开放时间与自建欧洲算力背景,可据此判断开源权重阵营的竞争位置。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物学世界模型,以及连接模型、科学工具、文献和实验人员的交互式编排框架组成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 的原生实时对话模型上加入近实时视频生成,让对话具备会听、会看、会说的动态视觉形象。
推荐理由:Gemini 3.8 Live 新增实时视频形象能力,读者可了解其多语言口型同步与后台工具调用如何用于企业对话场景。