Odyssey 开放世界模型 Odyssey-3 免费研究预览
Odyssey 面向公众开放世界模型 Odyssey-3 的研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,支持第一人称与第三人称视角;基础模型 14B 参数、生成 832 × 480 视频,Pro 版支持 1280 × 720。
Odyssey 面向公众开放世界模型 Odyssey-3 的研究预览,用户可用文本提示词生成可实时探索的交互环境,开发者可申请 API 访问。免费在线 demo 基于 Odyssey-3 Flash,支持第一人称与第三人称视角;基础模型 14B 参数、生成 832 × 480 视频,Pro 版支持 1280 × 720。
Liquid AI 发布 d1 决策模型家族的两款开放权重模型 d1-3B 和 d1-omni-600M(实验性)。d1-3B 在 Decision Index 0.2.1 上得分 48.57,为 10B 以下最佳,超过 Decider 35B-A3B 的 47.11,支持文本与图像,在 NVIDIA Jetson AGX Thor 上单次回答耗时 16 ms。
推荐理由:Liquid AI 公开两款决策模型及端侧与 GPU 实测延迟,可据此判断单次前向决策在边缘设备上的可用性。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:EmbeddingGemma 2 把文本、图像、音频、视频统一到同一嵌入空间,并给出端侧内存与向量截断的具体数据,便于评估本地多模态检索的可行性。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,将病理基础模型的计算需求大幅降低。GigaPath-Flash 采用 22M 参数的 ViT-S tile 编码器和 21M 参数的 LongNet slide 编码器,在 PANDA 和 EBRAINS 基准上以约 50 倍更少算力达到原版 GigaPath 3% 以内的性能。