JOTO
Contact us
← AI 智库
多模态模型

Qwen3.8-Flash:全新架构,更强更稳更划算

2026 年 8 月 26 日

通义千问发布Qwen3.8-Flash多模态MoE模型,主模型125B参数+51B N-gram Embedding,每token激活6B。采用GDN+QSA混合注意力、Gated Residual、N-gram Embedding与Muon Optimizer四大架构升级,支持262K原生上下文(可扩至1M),训练开销仅为Qwen3.7-Plus的1/9,API定价为每百万tokens输入1元、输出3元。

Qwen3.8-Flash核心规格与定位

今晚,我们正式发布 Qwen3.8-Flash,这是一个多模态 MoE 模型,主模型参数量为125B,额外配备 51B 的 N-gram Embedding,每 token 激活 6B 参数。 它原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。

Qwen3.8-Flash 围绕以下四个方面对模型进行了系统升级,在提升模型能力的同时,进一步优化计算效率、模型容量和训练稳定性:

  • Attention:采用 GDN + QSA Hybrid 架构。Gated DeltaNet(GDN)高效压缩历史信息;Qwen Sparse Attention(QSA) 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,显著降低长序列 Attention 开销。

  • Residual:引入 Gated Residual(GR),将 Residual Stream 扩展为 4 条分支,并通过动态 Gate 控制信息读写,增强跨层信息传递和训练稳定性。

  • Embedding:引入 N-gram Embedding,利用局部上下文进行查表,以很少的额外计算扩展模型容量;Embedding Table 可以卸载到 Host Memory,并通过异步 Prefetch 与模型计算重叠。

  • Optimization:采用 Muon Optimizer,围绕正交化精度、Muon 与 AdamW 的参数分工以及融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。

性能与成本优势

相比于 Qwen3.7-Plus,Qwen3.8-Flash显著降低了训练与推理成本,训练开销仅约为前者的 1/9,但在编码和办公任务上却具有更强的能力。

Qwen3.8-Flash即将上线千问AI平台,对外提供API服务,每百万Tokens输入1元,输出3元。今晚,Qwen3.8-Flash还将首发上线“千问办公”

Qwen3.8-Flash模型架构总览图
Qwen3.8-Flash模型架构总览

Attention:GDN + QSA,高效记忆与精准检索

传统的全局注意力(Full Attention)机制虽然能让模型直接访问所有历史信息,但随着上下文变长,其计算量和键值缓存(KV Cache)的访存成本会急剧上升,成为明显的性能瓶颈。

延续 Qwen3.5 的架构设计,Qwen3.8-Flash采用 GDN + AttentionHybrid 架构:在每四个网络层中,有三层使用 Gated DeltaNet(GDN),负责将历史信息持续压缩并存储在一个固定大小的循环状态中;剩下的一层则保留全局Attention,负责对全局信息进行精确检索。

针对这层全局 Attention,我们进一步引入 Qwen Sparse Attention(QSA)。Sparse Attention的核心思路是只关注重要的上下文,从而减少长序列的计算量。然而,现有的方案(如 DSA)通常仍需要一个 token 级别的indexer来定位重要位置;随着上下文不断增长,这个 indexer 本身的计算开销也会逐渐变成不可忽略的负担。

QSA 将这一过程进一步的优化与压缩:它使用轻量级的 indexer 先把序列聚合成micro-block,在 block 级别上估计上下文重要性,然后再选出最相关的区域执行 Attention计算。这种做法不仅减少了实际 Attention 的计算量,还大幅降低了“寻找重要上下文”本身的 indexing 成本。此外,与那些跨层共享索引的方案不同,QSA 在每一层内部独立完成序列压缩,对跨层 Attention 相似性的依赖更小,因此完美契合 GDN 与 Attention 交替出现的 Hybrid 架构。

可以简单理解为:GDN 负责高效“记住”,QSA 负责精准“查找”。

在实际性能表现上,面对 1M token 的超长上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段分别实现最高 7.6×4.9× 的加速。在贴近线上高缓存复用场景的实验设定下(Prefix Cache 命中率为 90%),Qwen3.8-Flash 在 1M 上下文下的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍

纯文本任务性能对比图
纯文本任务性能对比
多模态任务性能对比图
多模态任务性能对比

Residual:Gated Residual,给信息更多传递路径

在传统的 Transformer 架构中,所有网络层都共享同一条Residual Stream来进行信息的读写。随着网络层数的加深,早期特征不断与后续信息混合,重要信息更容易被逐渐稀释。

为了解决这个问题,我们引入了Gated Residual(GR) 机制。它巧妙地融合了两种前沿思路:一方面借鉴了Hyper-Connection 将residual stream扩展为多分支的设计;另一方面,又将GatedNorm 的逐元素动态门控融入 residual read。通过这种结合,原本单一的residual stream被扩展成了 4 条并行的分支。这使得模型能够根据当前的输入内容,动态且精细地决定从各个分支中读取多少信息,以及向各个分支中写入多少信息。

通俗来讲,可以把它理解为把一条信息通道扩展成多条车道:有些分支负责局部信息传递,有些则可以把早期信息直接保留到很深的网络层。实际分析中也观察到,其中一条branch会自然形成连接第一层 Attention 和大部分中后层的长距离通道。

此外,GR 还对 Hyper-Connection 进行了进一步简化。当信息的读取和写入已经足够灵活时,额外的 branch mixing 操作并不能带来明显的收益,因此可以直接将其省略。同时,归一化后的 Gate 能够有效抑制activation outlier,从而显著提升模型训练的稳定性。Residual State还支持使用 FP8 进行存储,这进一步大幅降低了系统的访存开销。

Embedding:N-gram Embedding,低成本扩展模型容量

受到 Gemma 3n 中 Per-Layer Embedding 和 DeepSeek Engram等工作的启发,我们进一步引入 N-gram Embedding,从 Transformer 参数之外的维度扩展模型容量。

普通 Embedding 根据单个 token 查表;N-gram Embedding 则结合当前 token 与前几个 token 组成的局部上下文进行查表,这种方式能够为模型中常见的短语搭配和局部语言模式提供更加丰富和精准的额外表示。

它的核心优势是:可以增加大量参数,同时几乎不增加每个 token 的计算量。

Qwen3.8-Flash 额外引入了 51B N-gram Embedding 参数。由于查询位置可以提前确定,这些参数可以存放在 Host Memory 中,通过异步 Prefetch 与模型计算重叠,无需长期占用 GPU 显存。

最终,模型只在前部使用一层 N-gram Embedding,以较低的额外成本增加了一个大规模的 “局部模式记忆库”。

Optimization:架构和优化协同设计

Qwen3.8-Flash 使用 Muon Optimizer训练,并围绕三个关键问题进一步优化 Muon 在大模型训练中的使用方式:正交化精度、Muon 与 AdamW 的参数分工,以及融合参数矩阵的拆分

对于真正作为二维线性映射的参数,例如 Attention、GDN 和 MoE Expert 中的主要权重,我们使用 Muon;Embedding、MoE Router、GR 低秩参数等则继续使用 AdamW。对于工程实现中融合存储的 QKV、SwiGLU 和 GDN Projection,则先按照实际对应的独立线性变换进行拆分,再分别执行正交化。

针对新的模型结构和 Optimizer,我们重新拟合了 Scaling Law。结果显示,模型可以稳定使用更大的 Learning Rate 和 Batch Size,进一步提升收敛效率和大规模并行训练吞吐。

实验还发现,过去大模型训练中常见的 Batch Size Warmup 已经不再必要:从小批次 Batch 逐渐增加到目标 Batch 并没有改善最终效果,反而需要额外执行 18.8% 的optimizer steps。因此,在最终训练配置中,我们直接从目标 Batch Size 开始训练。

其它架构优化

此外,其余组件沿用 Qwen3-Next 所确立、并在 Qwen3.5–Qwen3.8 系列中不断打磨的设计。

  • 极致稀疏 MoE:在全局负载均衡下,固定激活专家数量而持续增加专家总参数量,可稳定降低训练 loss。因此 Qwen3.8-Flash-Next 采用较大的专家池,每 token 只路由少量专家,并配合一个共享专家。

  • Multi-Token Prediction:MTP 模块以多步方式训练,保持训练与推理之间的一致性,从而提升实用场景下speculative decoding的接受率,同时也提升主干本身的性能。其中的全注意力层同样被替换为 QSA。

  • 训练稳定性:保留 Zero-Centered RMSNorm 并对 norm weight 施加 weight decay、注意力输出门控机制,以及 MoE router参数初始化的归一化。这些设计使小规模消融结果更为可靠,也有助于大规模训练平稳进行。

Qwen3.8-Flash模型结构示意图
Qwen3.8-Flash模型结构示意图

Base模型表现

我们将 Qwen3.8-Flash-Next-Base 与 Qwen3.8-27B 及 Qwen3.7-Plus 的 base 模型进行比较。

Attention模块结构对比图
Attention模块结构对比
Gated Residual结构示意图
Gated Residual结构示意图

在 6B 激活参数下,Qwen3.8-Flash-Next-Base 在 14 个 benchmark 中的 8 个上取得最优结果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 与 MMMLU;在 MMLU、MMLU-Redux、GPQA、MATH 与 MultiPL-E 上与 Qwen3.7-Plus-Base 接近。其中 51B 的 N-gram embedding 参数是确定性寻址的,不进入每 token 的矩阵乘预算。

总结

Qwen3.8-Flash-Next 在 Qwen3-Next 所引入的混合架构之上,沿 Attention、Residual、Embedding 与 Optimization 四个方向作了扩展。

QSA 在每一层内部将序列压缩为 micro-block,在保持精确检索能力的同时,降低了长上下文下的注意力开销与 indexing 开销。

Gated Residual 将残差流扩展为多条并行分支,并以逐元素的动态门控控制读写,在算术开销可忽略的前提下改善跨层信息传递与训练稳定性;残差状态还可以保存为 FP8,进一步降低访存量。

N-gram Embedding 以确定性寻址的查表记忆扩展容量,可以在几乎不增加每 token 计算的前提下扩展,并卸载到 host memory。

优化方面,Muon 作为主优化器使用,其中正交化精度、参数分工与融合矩阵拆分是决定性的实现选择,我们也针对新架构重新拟合了 Scaling Law。

Qwen3.8-Flash:全新架构,更强更稳更划算 配图 7

和此前发布 Qwen3-Next 时一样,这一次我们仍然选择提前开放这些权重,希望社区能够对这一全新的架构进行测验。我们也将继续对其进行完善,并逐步向 Qwen4 演进。

Base模型基准测试结果对比图
Base模型基准测试结果对比

JOTO 企业落地观察

  • 该架构中 N-gram Embedding 卸载至 Host Memory 并异步 Prefetch 的设计,对企业部署 RAG 知识工程具有明确启示:非核心参数可按需加载,降低 GPU 显存门槛,更适合在边缘或混合云环境中部署轻量化知识增强模块。
  • QSA 在 micro-block 粒度做上下文筛选,而非 token 级 indexing,意味着长文档处理中“关键片段识别”的计算开销可控;这对构建企业级智能体时的实时响应要求提供了更可预测的延迟边界。
  • Gated Residual 引入 4 分支残差流并支持 FP8 存储,虽未改变模型整体精度,但提升了训练稳定性与访存效率;这对企业客户在自有数据上开展小规模微调(Fine-tuning)时的收敛鲁棒性构成实质性支撑。
  • Muon Optimizer 与 AdamW 的参数分工策略(如 MoE Expert 用 Muon、Router 用 AdamW),为企业 AI 安全治理团队评估优化器行为一致性提供了清晰切口——不同参数组可配置独立审计策略与梯度裁剪规则。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.