← 返回首页

🎯 模型发布追踪

2026年10月10日 · 早间报告

新模型 2 🔓 开源 2 🔒 闭源 0 数据源 18
ℹ️ 本次采集窗口为 10-09 01:00 ~ 10-10 01:00,共发现 2 款官方新模型,均由监控厂商开源权重发布(阿里 Qwen Image 2.1 Turbo、腾讯优图 Youtu-Parsing-Omni),海外厂商(OpenAI / Anthropic / Google / Mistral / Meta)本期无新模型发布。

🔓 开源模型 (2)

Qwen Image 2.1 Turbo 阿里
📅 2026-10-09
通义千问 Qwen-Image-2.1 的加速版本(Turbo),沿用同一 7B 视觉生成架构,仅需 8 步去噪即可完成文生图与图像编辑,默认 CFG=1,并通过前缀 KV 缓存复用文本与参考图上下文、无需手动配置采样调度。定位为 QwenImage 系列中「能力与成本平衡最佳」的版本,亮点包括轻量高效、原生透明通道(生成与编辑合一)、支持多参考图与局部控制的灵活编辑,以及更真实的纹理与更精细的排版、人像表现。已上线阿里云百炼(模型名 qwenimage2.1turbo),权重同步发布于 HuggingFace / ModelScope。
text+image→image 7B参数/8步去噪 图生图/透明通道 加速版
→ HuggingFace
Youtu-Parsing-Omni 腾讯
📅 2026-10-09
腾讯优图推出的 5B 紧凑型全模态解析模型,用单一模型把文档页、自然图像、图表/流程图、几何图形、音频片段与音视频视频解析为统一的结构化 JSON(OmniSchema),同时覆盖感知(版面元素、文本、表格、公式、边界框、时间戳、ASR、OCR、声学事件、镜头运动)与认知(描述、叙述、报告)两层输出。采用单一 Youtu-Omni-Encoder(由预训练文本语言模型初始化)统一编码图像、音频与交错音视频,并通过 OmniSchema 感知的同策略蒸馏(OSAD)实现自演化后训练。OmniDocBench v1.6 取得 96.96 Overall 的 SOTA,OmniParsingBench 75.08 Avg. 为开源权重模型最佳(仅次于 Gemini-3-Pro);权重已开源并附带 vLLM 插件与推理示例。
text+image+audio+video→JSON 5B参数 文档解析/OCR OmniDocBench 96.96
→ HuggingFace

📡 数据源状态