阿里发布Qwen3.8-Max:2.4万亿参数杀入全球第一梯队,编程表现超越Claude Opus 5

2026/08/03 13:41阅读量 6

阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在权威榜单Arena中冲进全球第一梯队,编程表现超过Claude Opus 5和Fable 5 High版本。该模型在编程、长程任务、专业工作、多模态智能体等场景表现突出,定价为国内每百万Tokens输入12元、输出36元,国际价格仅为Opus 5的40%和24%。

事件概述

阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,定位在编程、专业工作、长程任务、多模态智能体等场景。在权威第三方榜单Arena中,Qwen3.8-Max冲进全球大模型第一梯队,表现直逼Anthropic的Claude系列;其中在编程能力(前端)榜单上超过Claude Opus 5和Fable 5的High版本。

核心信息

  • 定价:国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元;国际输入、输出价格分别为Opus 5的40%和24%。
  • 能力亮点
    • 编程能力:可将复杂任务端到端自主交付,从理解需求、搭建工程到运行实验、检查结果并持续优化。官方披露的极端案例中,模型从空文件夹出发、无人干预下自主推进十多天,交付完整可用项目。
    • 长程任务:具备系统级自主规划与执行能力,可在数千轮超长交互中保持目标不迷失。
    • 专业工作:一次交付通常需返修3至5轮的APP原型;一小时内处理数百份法律文档并完成上千个条款标注。
    • 多模态智能体:可消化数百页复杂材料、上百小时视频内容并整理为可用成果。
  • 评测对比:在科研复现、多模态理解、长视频和电脑操作等多项测试中超越GPT-5.6、Opus 4.8与Fable 5;编程、终端Agent和专业工作居行业头部。

实测表现

  • 编程端到端交付:编辑以完整产品需求文档(含核心功能、数据、页面体验、技术约束、验收标准等)要求Qwen3.8-Max从零开发AI资讯网页。模型约5分钟交付接近正式产品水准的成果,包含需求拆解、技术选型、项目结构、功能实现、问题解决记录和功能验收清单(逐项标记通过),运行无报错、功能完整。
  • 长文本交叉分析:针对一篇数十页的论文(复盘2010—2014年ImageNet大赛),模型约33秒完成对正文、表3、附录B图16的跨章节交叉分析,正确回答ILSVRC与PASCAL VOC两套评测数据集的难度对比问题,并生成了含物体大小、位置变化、定位难度、画面杂乱度等多维度的分析报告,原文表格被直接引用为证据。
  • 多模态长视频理解:对一期近70分钟的视频播客(内容涉及AI创业、OpenAI战略和未来社会等),模型两三分钟内生成按核心观点划分的完整主题时间轴,每个话题采用“先总结、再展开”的结构,并标注对应原始时间戳。

值得关注

Qwen系列自2023年开源以来累计开源400多个模型,衍生模型超20万个,累计下载量突破10亿次。从Qwen3到Qwen3.5再到Qwen3.8,迭代覆盖了基础推理、编程、专业工作、多模态理解、长程Agent直至端到端交付等场景。目前Qwen3.8的API已上线千问AI平台,并已接入阿里同步推出的Agent产品“千问办公”。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。