阿里通义发布Qwen3.8-Flash开源模型:125B参数MoE架构,训练成本仅前代1/9 - 果核剥壳

8月27日消息,阿里通义千问团队今晚正式发布Qwen3.8-Flash,并同时开源了Qwen3.8-Flash-Next的权重。据介绍,Next所采用的全新架构,将成为下一代Qwen4系列模型的雏形。

Qwen3.8-Flash是一个多模态MoE模型,主模型参数量为125B,额外配备51B的N-gram Embedding,每token激活6B参数。模型原生支持262,144 tokens上下文,并可通过YaRN技术扩展至1M tokens。

阿里通义发布Qwen3.8-Flash开源模型:125B参数MoE架构,训练成本仅前代1/9阿里通义发布Qwen3.8-Flash开源模型:125B参数MoE架构,训练成本仅前代1/9

此次升级围绕四大方向展开:

Attention:采用GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构。GDN负责高效压缩历史信息,QSA通过轻量级Indexer在micro-block粒度上筛选重要上下文。面对1M token超长上下文,其Attention Kernel在Prefill和Decode阶段分别实现最高7.6倍和4.9倍加速。

Residual:引入Gated Residual机制,将残差流扩展为4条并行分支,并通过动态Gate控制信息读写,残差状态支持FP8存储以降低访存开销。

Embedding:引入51B参数的N-gram Embedding扩展模型容量,这些参数可卸载至Host Memory,不长期占用GPU显存。

Optimization:采用Muon Optimizer,并针对新架构重新拟合了Scaling Law。

性能方面,Qwen3.8-Flash的训练成本仅为Qwen3.7-Plus的约九分之一,但在编码和办公任务上能力更强。在6B激活参数下,Qwen3.8-Flash-Next-Base在14个benchmark中的8个上取得最优结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 3小时前
下一篇 3小时前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注