← 返回首页

🎯 模型发布追踪

2026年10月9日 · 早间报告

新模型 3 🔓 开源 1 🔒 闭源 2 数据源 18
ℹ️ 10-08 11:15 ~ 10-09 01:00 时间窗内监控厂商无全新模型发布。本期为追溯补漏:收录上一轮 09-25 ~ 10-08 采集窗口遗漏的 3 款官方模型,卡片标注的是原始发布日期(09-30 / 10-06 / 10-07)。

🔒 闭源模型 (2)

Cohere Embed 5 Cohere
📅 2026-09-30
Cohere 新一代企业级检索嵌入模型家族,含 Pro(面向离线索引质量)与 Fast(面向低延迟高吞吐查询)两档,两档共享同一嵌入空间,可用 Pro 建索引、Fast 查询而无需重建索引。支持文本、图像与「文本+图像」融合输入,覆盖 100+ 语言,128K 上下文,Matryoshka 维度 256~2048,支持 float / int8 / binary 输出并可自托管。Pro 在 ViDoRe V3 平均 85.8、Fast 84.5,Fast 吞吐约为 Pro 的 2.4 倍(377.3 vs 159.7 docs/s)。定价 $0.12(Pro)/ $0.08(Fast)每百万 token,图像 $0.40。
text+image→embedding 128K上下文 检索/嵌入 100+语言
→ Cohere Blog
Liquid AI d1 Liquid AI
📅 2026-10-07
Liquid AI 推出的首款「决策模型」(decision model),把一个问题与文本/图像输入一起送入,单次前向直接输出概率分布而非生成 token;支持 Noul(二元概率)、Choice(标签概率)、Score(量表位置)三类决策,单次请求可包含多个问题,文本决策耗时约 200–300ms。是首个原生支持图像输入与多模态推理的决策模型,视觉检测类任务准确率 85–97%;在六个应用场景中与 GPT-6.1 Sol、Claude Opus 5.5 对比,四项不逊于 GPT-6.1 Sol,成本低 19~200 倍。按输入 token 计费、不计输出 token(图像按 32×32 像素块折算 1.5 token)。已通过 Liquid AI API(模型名 d1)、console.liquid.ai、Vercel 与 OpenRouter(暂为纯文本)提供。
text+image→决策 决策模型/单次前向 低延迟200–300ms
→ Liquid AI Blog

🔓 开源模型 (1)

EmbeddingGemma 2 Google
📅 2026-10-06
Google 开源的第二代轻量多模态嵌入模型,740M 总参数(模块化设计,可拆为 270M 纯文本 + 170M 视觉 + 300M 音频编码器),Apache-2.0 许可,权重发布于 HuggingFace 与 Kaggle。基于 Gemma 4 构建并复用其文本分词器与音频编码器,将文本、代码、图像、音视频映射到统一嵌入空间;MTEB Code 从 68.76 提升至 78.68,MAEB 在同尺寸模型中领先。采用 Matryoshka 表示,向量可从 768 截断至 512/256/128 维(最高 6 倍存储压缩);上下文 8K(一代的 4 倍),单次可处理最长 5.5 分钟音频、29 张图像或 58 帧视频,端侧量化后文本版仅约 191MB 常驻内存。
text+image+audio+video→embedding 8K上下文 740M参数 Apache-2.0
→ HuggingFace

📡 数据源状态