← 返回首页
🔒 闭源模型 (1)
📅 2026-09-03(官方公告日)
OpenAI旗舰模型,专为高要求端到端工作设计,适用于高级分析、软件工程、深度研究、科学工作与文档创作,擅长长周期任务。首个达到OpenAI「Critical」内部网络安全阈值的模型,在计算机操作、软件工程、专业工作与科学领域达到SOTA水平。支持105万token上下文窗口,最大输出128K token。定价:输入$10/百万token,输出$50/百万token。同模型提供Pro推理模式变体(Astra Pro)。
text→text
1.05M上下文
计算机使用
软件工程
深度研究
网络安全
→ OpenAI 官方博客
|
→ OpenRouter
🔓 开源模型 (3)
📅 2026-09-04(HuggingFace上架日)
腾讯视觉文档检索模型,包含8B旗舰教师模型与4.5B轻量学生模型。8B版在ViDoRe V3以66.75 nDCG@10排名行业第一,ViDoRe V1+V2达92.18排名第一;采用4096维token表示与双向全注意力机制。4.5B版支持Prefix-MRL与混合注意力配置(HAC),采用多向量ColBERT晚期交互机制。基于Qwen3.5架构,Apache-2.0开源。
image→retrieval
视觉文档检索
ViDoRe V3 #1
4096D表示
Apache-2.0
→ HuggingFace (EVIE-8B)
|
→ HuggingFace (EVIE-4.5B)
📅 2026-09-03(HuggingFace上架日)
智源研究院音频语言模型,基于RoboBrain与OpenMOSS Audio联合开发,为具身智能/机器人提供听觉理解能力。56亿参数,通过128-bin梅尔频谱编码器处理音频信号,在编码器第8/16/24层注入音频特征。使机器人在视觉之外获得360度遮挡感知的听觉能力。Apache-2.0开源。
audio→text
具身智能
机器人听觉
RoboBrain
Apache-2.0
→ HuggingFace
📅 2026-08-27(HuggingFace上架日,追溯发现)
通义千问首个自动驾驶视觉语言基础模型,在统一框架内集成3D感知、视觉问答与运动规划。基于Qwen3.5-4B架构,搭载BEV感知头(3D目标检测、语义占用预测、BEV地图分割)与规划专家模块(通过流匹配生成未来轨迹)。保持预训练VLM架构不变,同时获得驾驶专用能力与通用视觉理解。Apache-2.0开源。
image+text→text
自动驾驶
3D感知
运动规划
Apache-2.0
→ HuggingFace
📡 数据源状态
- ✅ OpenRouter API — 正常(1个新模型:GPT-6 Astra,已排除batch/Pro变体)
- ✅ HuggingFace API (18厂商) — 正常(3个新模型:EVIE-8B/4.5B, GaussianMind, Qwen-Drive)
- ✅ OpenAI 官方博客/CNBC — 正常(确认GPT-6 Astra于09-03发布)
- ✅ Anthropic 官方博客 — 正常(无新模型,09-04已报告Fable 5.1)
- ✅ Google 官方博客 — 正常(无新模型,09-04已报告Gemini 3.8 Flash)
- ✅ Meta AI 官方博客 — 正常(无新模型,09-04已报告Muse Spark 1.3)
- ✅ DeepSeek API Changelog — 正常(无9月新更新)
- ✅ 阿里云百炼新模型页 — 正常(无新模型,qwen3.8max0902为已有模型快照更新)
- ✅ 搜索引擎补充 — 正常(确认各厂商无额外新模型)
- ✅ Mistral/Cohere/NVIDIA/xAI/ByteDance — 正常(均无9月新模型发布)