
Qwen3.8-Flash开源:125B参数MoE架构,训练效率提升至前代九分之一
阿里通义发布Qwen3.8-Flash,采用125B参数MoE架构,训练效率显著提升,成本仅为前代模型的九分之一。
Qwen3.8-Flash新特性概述
阿里通义千问团队最新发布了Qwen3.8-Flash,并开源了Qwen3.8-Flash-Next的权重。该模型采用了全新的MoE架构,有望成为下一代Qwen4系列模型的基石。

Qwen3.8-Flash模型参数量为125B,并配备51B的N-gram Embedding,支持高达1M tokens的上下文。模型在Attention、Residual、Embedding和Optimization四个方面进行了全面升级。

- Attention:采用GDN+QSA混合架构,大幅提升超长上下文的处理速度。
- Residual:引入Gated Residual机制,提高残差流的并行处理能力。
- Embedding:扩展模型容量,参数可卸载至Host Memory,优化显存使用。
- Optimization:采用Muon Optimizer,优化Scaling Law。
性能方面,Qwen3.8-Flash在训练成本上较Qwen3.7-Plus降低至九分之一,同时在编码和办公任务上表现更佳。