← 返回首页
ℹ️ 本次采集窗口为 10-09 01:00 ~ 10-10 01:00,共发现 2 款官方新模型,均由监控厂商开源权重发布(阿里 Qwen Image 2.1 Turbo、腾讯优图 Youtu-Parsing-Omni),海外厂商(OpenAI / Anthropic / Google / Mistral / Meta)本期无新模型发布。
🔓 开源模型 (2)
📅 2026-10-09
通义千问 Qwen-Image-2.1 的加速版本(Turbo),沿用同一 7B 视觉生成架构,仅需 8 步去噪即可完成文生图与图像编辑,默认 CFG=1,并通过前缀 KV 缓存复用文本与参考图上下文、无需手动配置采样调度。定位为 QwenImage 系列中「能力与成本平衡最佳」的版本,亮点包括轻量高效、原生透明通道(生成与编辑合一)、支持多参考图与局部控制的灵活编辑,以及更真实的纹理与更精细的排版、人像表现。已上线阿里云百炼(模型名 qwenimage2.1turbo),权重同步发布于 HuggingFace / ModelScope。
text+image→image
7B参数/8步去噪
图生图/透明通道
加速版
→ HuggingFace
📅 2026-10-09
腾讯优图推出的 5B 紧凑型全模态解析模型,用单一模型把文档页、自然图像、图表/流程图、几何图形、音频片段与音视频视频解析为统一的结构化 JSON(OmniSchema),同时覆盖感知(版面元素、文本、表格、公式、边界框、时间戳、ASR、OCR、声学事件、镜头运动)与认知(描述、叙述、报告)两层输出。采用单一 Youtu-Omni-Encoder(由预训练文本语言模型初始化)统一编码图像、音频与交错音视频,并通过 OmniSchema 感知的同策略蒸馏(OSAD)实现自演化后训练。OmniDocBench v1.6 取得 96.96 Overall 的 SOTA,OmniParsingBench 75.08 Avg. 为开源权重模型最佳(仅次于 Gemini-3-Pro);权重已开源并附带 vLLM 插件与推理示例。
text+image+audio+video→JSON
5B参数
文档解析/OCR
OmniDocBench 96.96
→ HuggingFace
📡 数据源状态
- ✅ OpenRouter API — 正常(无监控厂商新模型)
- ✅ HuggingFace API(35厂商)— 正常(发现 2 个)
- ✅ 阿里云百炼新模型发布页 — 正常(发现 1 个:qwenimage2.1turbo)
- ✅ DeepSeek API Changelog — 正常(无新发布)
- ✅ OpenAI Blog / News — 正常(无新发布)
- ✅ Anthropic News — 正常(无新发布)
- ✅ Google AI Blog / DeepMind / Gemini API Changelog — 正常(无新发布)
- ✅ Meta AI Blog — 正常(无新发布)
- ✅ Mistral AI News — 正常(无新发布)
- ✅ MiniMax News — 正常(无新发布)
- ✅ Cohere Blog / Changelog — 正常(无新发布)
- ✅ Liquid AI Blog — 正常(无新发布)
- ✅ Black Forest Labs Release Notes — 正常(无新发布)
- ✅ xAI News / ByteDance Seed — 正常(无新发布)
- ✅ 智谱 Z.ai / 月之暗面 / 快手 / 小米 / 商汤 / 智源 / 百川 / 零一万物 — 正常(无新发布)
- ✅ Artificial Analysis — 正常(无新发布)
- ✅ 搜索引擎补充(Google 搜索 / 量子位 / 机器之心 / 行业订阅通讯)— 正常(无新模型线索)
- ✅ NVIDIA / 上海AI实验室 / 阶跃星辰 / 商汤 HF 组织 — 正常(仅研究/任务检查点,已排除)