← 返回首页

🎯 模型发布追踪

2026年9月8日 · 凌晨报告

新模型 4 🔓 开源 3 🔒 闭源 1 数据源 10 采集时间 01:00

🔒 闭源模型 (1)

GPT-6 Astra OpenAI
📅 2026-09-03(官方公告日)
OpenAI旗舰模型,专为高要求端到端工作设计,适用于高级分析、软件工程、深度研究、科学工作与文档创作,擅长长周期任务。首个达到OpenAI「Critical」内部网络安全阈值的模型,在计算机操作、软件工程、专业工作与科学领域达到SOTA水平。支持105万token上下文窗口,最大输出128K token。定价:输入$10/百万token,输出$50/百万token。同模型提供Pro推理模式变体(Astra Pro)。
text→text 1.05M上下文 计算机使用 软件工程 深度研究 网络安全
→ OpenAI 官方博客 | → OpenRouter

🔓 开源模型 (3)

Tencent EVIE 腾讯
📅 2026-09-04(HuggingFace上架日)
腾讯视觉文档检索模型,包含8B旗舰教师模型与4.5B轻量学生模型。8B版在ViDoRe V3以66.75 nDCG@10排名行业第一,ViDoRe V1+V2达92.18排名第一;采用4096维token表示与双向全注意力机制。4.5B版支持Prefix-MRL与混合注意力配置(HAC),采用多向量ColBERT晚期交互机制。基于Qwen3.5架构,Apache-2.0开源。
image→retrieval 视觉文档检索 ViDoRe V3 #1 4096D表示 Apache-2.0
→ HuggingFace (EVIE-8B) | → HuggingFace (EVIE-4.5B)
BAAI GaussianMind 智源
📅 2026-09-03(HuggingFace上架日)
智源研究院音频语言模型,基于RoboBrain与OpenMOSS Audio联合开发,为具身智能/机器人提供听觉理解能力。56亿参数,通过128-bin梅尔频谱编码器处理音频信号,在编码器第8/16/24层注入音频特征。使机器人在视觉之外获得360度遮挡感知的听觉能力。Apache-2.0开源。
audio→text 具身智能 机器人听觉 RoboBrain Apache-2.0
→ HuggingFace
Qwen Drive 1.0 阿里
📅 2026-08-27(HuggingFace上架日,追溯发现)
通义千问首个自动驾驶视觉语言基础模型,在统一框架内集成3D感知、视觉问答与运动规划。基于Qwen3.5-4B架构,搭载BEV感知头(3D目标检测、语义占用预测、BEV地图分割)与规划专家模块(通过流匹配生成未来轨迹)。保持预训练VLM架构不变,同时获得驾驶专用能力与通用视觉理解。Apache-2.0开源。
image+text→text 自动驾驶 3D感知 运动规划 Apache-2.0
→ HuggingFace

📡 数据源状态