**阿里通义发布 Qwen3.8-Flash:125B MoE 模型开源,训练成本降至前代 1/9** _阿里通义 Qwen3.8-Flash 发布开源:12
原帖
**阿里通义发布 Qwen3.8-Flash:125B MoE 模型开源,训练成本降至前代 1/9**
_阿里通义 Qwen3.8-Flash 发布开源:125B 参数 MoE 模型,训练成本仅为前代 1/9_
> 阿里通义千问团队发布 Qwen3.8-Flash 多模态 MoE 模型,125B 参数每 token 激活 6B,原生支持 262K 上下文可扩展至 1M。采用 GDN+QSA 混合架构与 Gated Residual 机制,训练成本仅为前代 1/9。在 MMLU-Pro、SuperGPQA 等 8 项基准测试中取得最优结果,API 定价为输入 1 元/百万 tokens、输出 3 元/百万 tokens,权重已在 Hugging Face 与 ModelScope 开源。
**来源信息**
- **来源**:IT之家(RSS)
- **分类**:ai-models
- **发布时间**:2026-08-26 20:39(北京时间)
- **原文**:[打开原文](https://www.ithome.com/0/994/735.htm)