← 返回首页

🎯 模型发布追踪

2026年9月22日 · 补录报告(采集任务09-12~09-21未运行)

新模型 11 🔓 开源 3 🔒 闭源 8 数据源 8

🔒 闭源模型 (8)

Grok 4.7 xAI
📅 2026-09-21
xAI 最强编程与知识工作模型,速度翻倍、价格减半,支持长文档处理和复杂代码生成。
text→text 编程优化
→ xAI 官方公告
GLM 5.3 FlashX 智谱
📅 2026-09-18
智谱高速原生多模态模型,推理速度达 200 tokens/s,支持 1M 上下文、128K 输出、原生图片/视频/文件输入。
text+image+video+file→text 1M上下文 200 tokens/s
→ OpenRouter
Gemini 3.8 Live Google
📅 2026-09-15
Google 实时语音 AI 模型,支持自然对话交互,同步推出 Extended Thinking 扩展思考模式。
audio→audio 实时语音 Extended Thinking
→ Google 官方博客
Step 5 Preview 阶跃星辰
📅 2026-09-21
阶跃星辰旗舰 MoE 基座模型,600B 总参数 27B 激活,1M Token 上下文,支持视觉输入,专为 Agentic 任务和金融场景优化。
text+image→text 1M上下文 600B MoE Agentic
→ StepFun 官方
Qwen 3.8 Omni Flash 阿里
📅 2026-09-17
通义全模态 Flash 模型,支持文本/图像/音频/视频输入与文本输出,具备思考/非思考模式、Function Calling、联网搜索和上下文缓存。
text+image+audio+video→text 全模态 Function Calling
→ 阿里云百炼
Qwen 3.8 Omni Flash Realtime 阿里
📅 2026-09-21
通义实时全模态模型,支持多通道音频/视频实时交互,通过 WebSocket、WebRTC、AOQ 协议支持远程 MCP 工具调用。
audio+video→audio 实时交互 WebSocket/WebRTC
→ 阿里云百炼
Qwen Audio 3.1 Realtime Plus 阿里
📅 2026-09-20
通义实时双工语音对话模型,262K 上下文,新增 8 种系统音色,支持 Function Calling、联网搜索和声音克隆。
audio→audio 262K上下文 实时双工 声音克隆
→ 阿里云百炼
Qwen MT Uni 阿里
📅 2026-09-16
通义多模态翻译模型,单次调用处理文本/文档(PDF/Word/PPT/Excel)/图像/音频,自动模态检测、版面还原和声音克隆。
text+doc+image+audio→text 多模态翻译 版面还原
→ 阿里云百炼

🔓 开源模型 (3)

Xiaomi MiMo V2.6 Pro 小米
📅 2026-09-21
小米开源大模型,Artificial Analysis Intelligence Index 评测最高分开源模型,QAT 量化 retaining 98.2% 性能。同步推出 Flash 和 UltraSpeed 变体。
text→text 最高分开源 QAT量化
→ HuggingFace
Qwen Image 2.1 阿里
📅 2026-09-20
7B 开源图像生成与编辑统一模型,原生透明度支持,文本生成与图像编辑合一。支持文本到图像(T2I)和图像到图像(I2I)两种模式。
text→image 7B参数 原生透明度 开源权重
→ Qwen 官方博客
Tencent WeVisDoc 腾讯
📅 2026-09-16
腾讯端到端文档解析 OCR 模型,2B/4B 双规格,Apache 2.0 许可,从覆盖到能力实现鲁棒文档解析。
image→text 文档解析 OCR Apache 2.0
→ HuggingFace

📡 数据源状态