← 返回首页

🎯 模型发布追踪

2026年7月31日 · 更新报告

新模型 8 🔓 开源 2 🔒 闭源 5 📋 计划开源 1 数据源 12

🔓 开源模型 (2)

Inkling 🔄 追溯 Thinking Machines
📅 2026-07-15(原发布日期) · 发现于 2026-07-31
前OpenAI CTO Mira Murati创办的Thinking Machines Lab首个开源大模型。975B总参/41B活跃 MoE架构,原生多模态(文本+图像+音频),支持可编程思考努力调节(0.2-0.99),1M上下文窗口。Apache 2.0许可。SWE-bench Verified 77.6%,AIME 2026 97.1%,VoiceBench 91.4%。特色:抗审查设计,StrongREJECT 98.6%。
文本+图像+音频 MoE 975B/41B 1M上下文 Apache 2.0
📎 Thinking Machines Blog
Inkling Small Thinking Machines
📅 2026-07-30
Inkling轻量版,276B总参/12B活跃 MoE架构,针对低延迟和低成本工作负载优化。接近旗舰版性能的约1/4规模,从预览版正式毕业发布。Apache 2.0许可。
文本+图像+音频 MoE 276B/12B Apache 2.0
📎 VentureBeat

🔒 闭源模型 (5)

DeepSeek V4 Flash 0731 DeepSeek
📅 2026-07-31
DeepSeek V4 Flash官方版(公测),基于V4-Flash-Preview重新后训练,架构和规模不变(284B总参/13B活跃MoE)。Agent能力大幅增强:AA Intelligence Index 50分(比Preview版+10,超越V4-Pro),GDPval-AA v2 Elo 1559(原1189),Terminal-Bench 2.1 82.7%。原生支持Responses API格式并适配Codex。1M上下文,定价$0.14/$0.28不变。预计数周内开源权重。
文本 MoE 284B/13B 1M上下文 Agent 计划开源
📎 DeepSeek API Changelog
Gemini Robotics ER 2 Google
📅 2026-07-30
Google DeepMind 最强的具身推理(ER)模型,是视觉语言模型(VLM),充当机器人代理,使机器人能够与人交流、理解物理世界并规划持续数分钟的多步骤任务。API端点 gemini-robotics-er-2-preview。
视觉+语言→推理 具身推理 机器人 Public Preview
📎 DeepMind Blog
QwenAudio 3.0 ASR Flash 阿里
📅 2026-07-30
通义千问音频3.0系列语音识别Flash模型,支持汉语七大方言及20+地区口音,优化古诗词识别准确率,支持中英日韩等30个语种,增强标点预测与文本归一化能力,支持热词和上下文能力。含3种部署模式:实时流式、非实时文件转写、非实时。
语音→文本 ASR 30语种 方言识别
📎 阿里云百炼
Seedance 2.5 字节跳动
📅 2026-07-31
字节跳动Seed新一代视频生成模型,支持电影级4K输出,最长30秒单次生成视频,灵活参考功能(图片/视频参考生成)。即梦Web端上线,API计划8月7日开放。
文本/图片→视频 4K 30秒视频 视频生成
📎 ByteDance Seed Blog
MiniMax H3 MiniMax
📅 2026-07-31
MiniMax全新H系列视频生成模型,支持2K原生音频视频生成,$0.13/clip。区别于Hailuo系列,是全新的H系列视频产品线。
文本→视频 2K视频 原生音频 视频生成
📎 Reuters

🔄 追溯发现 (1)

QwenImage 3.0 Pro 🔄 追溯 阿里
📅 2026-07-20(原发布日期) · 发现于 2026-07-31
通义千问图像3.0 Pro版,支持4.5K token输入,12种语言文字渲染,20+字体,密集信息布局能力。区别于基础版Qwen Image 3.0的增强Pro变体。
文本→图像 Pro版 4.5K输入 12语言
📎 阿里云百炼

📡 数据源状态