8月27日消息,阿里通义千问团队今晚正式发布Qwen3.8-Flash,并同时开源了Qwen3.8-Flash-Next的权重。据介绍,Next所采用的全新架构,将成为下一代Qwen4系列模型的雏形。
Qwen3.8-Flash是一个多模态MoE模型,主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数。模型原生支持262,144 tokens上下文,并可通过YaRN技术扩展至1M tokens。


此次升级围绕四大方向展开:
Attention:采用GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN负责高效压缩历史信息,QSA通过轻量级Indexer在micro-block粒度上筛选重要上下文。面对1M token超长上下文,其Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍加速。
Residual:引入Gated Residual机制,将残差流扩展为4条并行分支,并通过动态Gate控制信息读写,残差状态支持FP8存储以降低访存开销。
Embedding:引入51B参数的N-gram Embedding扩展模型容量,这些参数可卸载至Host Memory,不长期占用GPU显存。
Optimization:采用Muon Optimizer,并针对新架构重新拟合了Scaling Law。
性能方面,Qwen3.8-Flash的训练成本仅为Qwen3.7-Plus的约九分之一,但在编码和办公任务上能力更强。在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU。

微信扫一扫
支付宝扫一扫 