模型更新

千问发布 Qwen3.8-Flash,并开放 Qwen3.8-Flash-Next 权重

发布于 来源:千问大模型公众号相关站点:阿里巴巴

千问官方发布 Qwen3.8-Flash 多模态 MoE 模型,并同步开放 Qwen3.8-Flash-Next 权重。新模型主模型参数量为 125B,额外配备 51B N-gram Embedding,每 token 激活 6B 参数,原生支持 262,144 token 上下文并可通过 YaRN 扩展至 1M token。

发生了什么

2026 年 8 月 26 日,千问大模型公众号发布 Qwen3.8-Flash,称其为一个多模态 MoE 模型。官方信息显示,该模型主模型参数量为 125B,额外配备 51B N-gram Embedding,每 token 激活 6B 参数;上下文长度原生支持 262,144 token,并可通过 YaRN 扩展至 1M token。

同一篇文章还宣布开放 Qwen3.8-Flash-Next 权重。官方将 Next 新架构称为全新一代 Qwen4 系列模型的雏形,希望先让社区对结构改动进行测试和反馈。

主要变化

这次更新围绕四个方向展开:Attention、Residual、Embedding 与 Optimization。Attention 部分采用 GDN + QSA Hybrid 架构,其中 GDN 负责压缩历史信息,QSA 在 micro-block 粒度筛选重要上下文,以降低长序列 Attention 与索引成本。

Residual 部分引入 Gated Residual,将残差流扩展为 4 条分支,并通过动态 Gate 控制信息读写;Embedding 部分引入 N-gram Embedding,用局部上下文查表扩展模型容量;Optimization 部分采用 Muon Optimizer,并围绕正交化精度、Muon 与 AdamW 的参数分工、融合参数拆分等策略重新优化训练。

官方还称,相比 Qwen3.7-Plus,Qwen3.8-Flash 的训练开销约为前者的 1/9,并将在编码和办公任务上有更强能力。API 服务即将上线千问 AI 平台,文章中给出的价格为每百万 tokens 输入 1 元、输出 3 元;具体上线时间和最终计费仍应以千问 AI 平台后续公开说明为准。

对用户有什么影响

对开发者来说,这条动态意味着千问系列在长上下文、多模态和低激活参数 MoE 方向继续推进。Qwen3.8-Flash-Next 权重在 Hugging Face 与 ModelScope 发布后,研究者和工程团队可以更早评估新架构在长文本、办公、编码和多模态场景中的表现。

对使用千问 API 的团队来说,Qwen3.8-Flash 若按官方文章中的价格上线,可能成为一个面向高性价比推理、长上下文处理和办公场景的选择。但文章发布时 API 仍处于“即将上线”状态,生产接入前需要再次核对模型名称、价格、上下文限制和服务可用区域。

相关背景

Qwen 近几个版本持续围绕稀疏 MoE、长上下文和推理效率演进。此次 Qwen3.8-Flash-Next 沿用并扩展 Qwen3-Next 的混合架构,同时提前开放权重和技术报告,说明千问团队希望在 Qwen4 完整模型家族推出前,让社区先验证这些架构选择的实际效果。