阿里开源Qwen3.8-Flash:新架构实现千亿参数仅激活6B,性价比颠覆行业
2026/08/26 20:46阅读量 2
阿里发布并开源千问最新模型Qwen3.8-Flash,采用全新Next架构,在千亿总参数量下仅激活60亿参数(6B),性能超越Claude Opus 4.6。得益于架构革新,其训练成本较上一代骤降90%,推理价格低至DeepSeek-V4-Flash的1/3,创下全球模型效率与性价比新基准。该模型已集成至“千问办公”,并为下一代Qwen4模型奠定技术基础。
事件概述
2026年8月26日晚,阿里发布并同步开源了千问系列最新模型 Qwen3.8-Flash。该模型基于全新的下一代(Next)架构,旨在通过极致的效率优化,在保持高性能的同时大幅降低计算资源消耗。目前,Qwen3.8-Flash权重已在 Hugging Face 和魔搭社区全面开源,供全球开发者使用。
核心信息
1. 架构革新:千亿参数,仅激活6B
- 混合专家(MoE)结构:Qwen3.8-Flash 是一个多模态 MoE 模型,Transformer 总参数量为 125B,但每次推理仅激活 6B 参数。
- 性能表现:尽管激活参数极少,其性能表现超越了 Claude Opus 4.6,并接近 Opus 4.8。仅完成预训练的基座模型(Base),在通用能力(SuperGPQA)、数学推理(GSM8K)和编程(SWEBench-Pretrain)等基础评测中,超越了参数量为其3倍的 Qwen3.7-Plus 基座模型。
2. 关键技术创新
- QSA 稀疏注意力机制:引入独特的 Qwen Sparse Attention (QSA) 机制,与 GDN 高效融合形成混合注意力架构。在高缓存命中的 1M Tokens 长上下文场景中,推理速度提升 8 倍以上。
- Gated Residual 信息传递:将传统 Transformer 的单条信息主通道拆分为 4 条,使模型能动态决定信息的读写,提升了信息传递效率和训练稳定性。
- N-gram Embedding 参数扩展:引入 51B 的 N-gram Embedding 参数作为“外挂”记忆指南手册,在不增加 Token 计算负担的前提下,提高了参数扩展效率。
- 协同优化:模型结构与训练方案协同优化,显著提升了收敛效率和训练吞吐量。
3. 极致性价比与成本下降
- 训练成本:相比上一代 Qwen3.7-Plus,Qwen3.8-Flash 仅用九分之一的资源完成训练,训练成本大幅下降约 90%。
- 推理成本:每百万 Tokens 输入价格为 1 元,输出为 3 元。
- 仅为 Claude Opus 4.6 价格的 3%。
- 为 DeepSeek-V4-Flash 闲时价格的 2/3,忙时价格的 1/3。
4. 智能体与多模态能力跃升
- 智能体任务:在 SWE-bench Pro(智能体编程)评测中领先 Opus 4.6 达 9.1 分;在 CoWorkBench、Toolathlon Verified 等专业任务和工具调用任务中超越 DeepSeek-V4-Flash;在 JobBench 专业工作智能体评测中超出 Opus 4.6 近 20 分。
- 多模态能力:在 AndroidWorld(模拟手机操作)评测中比 Opus 4.6 高出 22.5 分;在 MathVision(视觉推理数学)任务中超出 25.1 分;在具身智能 ERQA 任务中领先 31.5 分。
值得关注
- 应用落地:Qwen3.8-Flash 已首发上线“千问办公”,其“标准模式”内置该模型,可处理 95% 的日常办公任务。开发者和企业也可通过千问 AI 平台获取 API 服务。
- 未来展望:此次采用的 Next 新架构被视为全新一代千问大模型 Qwen4 的雏形。团队正通过开源社区反馈,进一步优化以打造 Qwen4。
- 生态规模:截至目前,Qwen3.8 系列已开源发布 Qwen3.8-Max、Qwen3.8-27B 及 Qwen3.8-Flash 三大尺寸模型。Qwen 模型全球下载量突破 30 亿次,衍生模型数超 30 万个,持续推动全尺寸、全模态的开源浪潮。
