← 返回首页

🎯 模型发布追踪

2026年9月4日 · 晚间报告

新模型 7 🔓 开源 0 🔒 闭源 7 数据源 8 采集时间 18:00

🔒 闭源模型 (7)

Claude Fable 5.1 Anthropic
📅 2026-09-01(官方公告日)
Anthropic最先进的编程和知识工作模型,在长期问题求解和Agent科研方面表现卓越。TerminalBenchScience 52.6%,OSWorld 2.0 77.9%部分通过,Humanity's Last Exam 60.9%(无工具)/65.0%(有工具),AutomationBench 31.4%。输入$10/百万token,输出$50/百万token,比Fable 5成本降低约25%。同模型的安全限制变体Mythos 5.1面向网络安全和生命科学专业人员,通过CVP和LSVP计划受限访问。
text→text 编程 知识工作 Agent科研 计算机使用
→ Anthropic 官方博客 | → OpenRouter
Meta Muse Spark 1.3 Meta
📅 2026-09-02(官方公告日)
Meta Muse Spark系列最新模型,在Agent和编程任务上实现系列最大幅度提升。支持1M token上下文窗口,具备显式推理模式可增强复杂问题求解。覆盖计算机使用、浏览器搜索、终端编程、长周期SWE任务等Agent场景。提供低成本的contributor变体(数据可用于改进Meta产品)。Zuckerberg称其前沿性能"几乎廉价到不值得计量"。
text→text 1M上下文 Agent 编程 显式推理
→ Meta AI Research | → OpenRouter
Google Gemini 3.8 Flash Google
📅 2026-09-02(官方公告日)
Google最智能的工作模型,在软件工程、Agent任务和多步推理上显著提升。设计理念为"3.8 Flash works harder"——执行额外推理步骤并迭代调用工具。DeepSWE、Finance Agent、Legal Agent等基准超越3.7 Flash。HLE-Verified 54.9%。定价$0.75/百万输入token,$3.75/百万输出token,与3.7 Flash持平。
text→text 软件工程 Agent 多步推理 工作模型
→ Google 官方博客 | → OpenRouter
Google Gemini 3.8 Flash Cyber Google
📅 2026-09-02(官方公告日)
Google面向网络安全防御的专用模型,在漏洞发现和自动修复方面达到前沿水平。20语言漏洞基准成功率超70%,CWE-Bench修复率47.2%。Chrome安全团队修补正确率2.6倍于更大商业模型,Wiz渗透测试召回率提升7.5-9.7%。仅通过Fairwind Program提供给受信任的防御者(政府、关键基础设施运营商和软件维护者)。
text→text ⚠️ 受限访问 网络安全 漏洞检测 自动修复
→ Google 官方博客
Inception Mercury 2.5 Preview Inception
📅 2026-08-31(OpenRouter上架日)
Inception最新扩散式大语言模型(dLLM),以1107 token/秒的速度成为最快推理LLM。不同于传统自回归模型逐token生成,可并行生成和优化多个token。相比Mercury 2在智能上提升10+分,质量可媲美GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite等模型。支持可调推理级别、并行工具调用、JSON输出,适合搜索Agent、语音管线和编程子Agent等延迟敏感场景。
text→text 扩散式LLM 高速推理 1107 tok/s Preview
→ OpenRouter
Qwen3.7 Text Reranker 阿里
📅 2026-09-01(百炼上架日)
基于Qwen3.7的多语言通用文本重排序模型,相比前代重排模型在网页/代码检索、指令遵循和Agent/记忆检索方面大幅提升,网页搜索提升约35%。
text→rerank 多语言 文本重排序 检索增强
→ 阿里云百炼
Qwen3.7 Text Embedding Flash 阿里
📅 2026-09-01(百炼上架日)
基于Qwen3.7的轻量级多语言文本向量模型,面向成本和吞吐敏感场景。语言覆盖从100扩展到201种语言,长文本处理从32K扩展到128K,支持稀疏向量。
text→embedding 201语言 128K长文本 稀疏向量 轻量级
→ 阿里云百炼

📡 数据源状态