Qwen3.8-Flash 发布:125B MoE 架构,激活参数仅 6B,训练成本大幅降低

2026/08/27 11:39阅读量 3

通义千问团队发布 Qwen3.8-Flash 模型,采用 1250 亿总参数的混合专家(MoE)架构,推理时仅激活 60 亿参数。该模型在保持高性能的同时,将训练成本压缩至前代模型的九分之一,显著提升了效率与经济性。

事件概述

通义千问团队正式发布了新一代大语言模型 Qwen3.8-Flash。该模型基于高效的混合专家(Mixture of Experts, MoE)架构设计,旨在平衡模型性能、推理速度与训练成本。

核心信息

  • 架构规模
    • 总参数量:1250 亿(125B)。
    • 激活参数量:60 亿(6B)。这种稀疏激活机制使得模型在推理过程中仅需调用部分专家网络,从而大幅降低计算开销。
  • 成本优化
    • 相比前代模型,Qwen3.8-Flash 的训练成本降低至原来的 1/9。这一突破性的成本缩减主要得益于 MoE 架构的高效性以及训练策略的优化。
  • 技术特点
    • 通过精细调整专家路由机制,模型在保持高吞吐量的同时,实现了更低的延迟和更高的资源利用率。

值得关注

Qwen3.8-Flash 的发布标志着开源社区在构建高性价比、大规模基础模型方面取得了重要进展。其极低的激活参数比例和训练成本优势,使其更适合需要高频推理或资源受限场景下的部署应用。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。