Qwen3.8-Flash开源:125B参数MoE架构,训练效率提升至前代九分之一

阿里通义发布Qwen3.8-Flash,采用125B参数MoE架构,训练效率显著提升,成本仅为前代模型的九分之一。

5效率工具模型优化训练效率MoE架构阿里通义

Qwen3.8-Flash新特性概述

阿里通义千问团队最新发布了Qwen3.8-Flash,并开源了Qwen3.8-Flash-Next的权重。该模型采用了全新的MoE架构,有望成为下一代Qwen4系列模型的基石。

阿里通义发布Qwen3.8-Flash开源模型:125B参数MoE架构,训练成本仅前代1/9插图

Qwen3.8-Flash模型参数量为125B,并配备51B的N-gram Embedding,支持高达1M tokens的上下文。模型在Attention、Residual、Embedding和Optimization四个方面进行了全面升级。

阿里通义发布Qwen3.8-Flash开源模型:125B参数MoE架构,训练成本仅前代1/9插图

  • Attention:采用GDN+QSA混合架构,大幅提升超长上下文的处理速度。
  • Residual:引入Gated Residual机制,提高残差流的并行处理能力。
  • Embedding:扩展模型容量,参数可卸载至Host Memory,优化显存使用。
  • Optimization:采用Muon Optimizer,优化Scaling Law。

性能方面,Qwen3.8-Flash在训练成本上较Qwen3.7-Plus降低至九分之一,同时在编码和办公任务上表现更佳。

下载与官方信息

更多关于Qwen3.8-Flash的信息和下载,请访问