阿里发布Qwen3.8:编程办公能力升级,推理更快更稳
阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量达2.4万亿,在编程和办公场景能力显著提升,权威榜单Arena中仅次于Anthropic Claude系列。Qwen3.8-Max已开放API,并计划下周开源,同时将开源Qwen3.8-27B。
事件概述
8月3日,阿里巴巴发布新一代基座大模型Qwen3.8,总参数量2.4万亿,激活参数95B。该模型在编程(Coding)与专业办公(Cowork)方面能力大幅提升,API已上线千问AI平台,并接入同步推出的Agent产品“千问办公”。Qwen3.8-Max预计下周开源,同时还将开源Qwen3.8-27B。
核心信息
- 模型架构:采用稀疏MoE架构与混合注意力机制联合优化,支持视觉理解,上下文长度达1M Tokens,实现更高推理效率和更快推理速度。
- 榜单表现:在权威三方榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列,整体处于全球第一梯队。Qwen3.8-Max在CodeArena中位居全球第四,Vision Arena中排名全球第二。
- 评测成绩:Qwen3.8-Max在编程智能体评测PaperBench中拿下93.0分,较上代提升28.2分;通用智能体评测WideSearch和Agent's Last Exam分别取得81.9分和52.4分;指令遵循IF Bench为82.8分;科学推理GPQA Diamond为92.6分;视觉推理BabyVision(无工具)为82.0分;电脑操作能力OSWorld-Verified为86.1分,位居主流模型首位。
- API定价:国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元;输入与输出的国际价格分别为Opus5的40%和24%。
能力亮点
自主编程:从零完成真实项目
Qwen3.8可从空文件夹出发,自主完成十数天的真实项目交付,全程无需人工干预。例如仅凭一句“创建一个自进化的智能体Harness”,模型独立编程约16天,做出了一个真实可用的自进化智能体框架“oh-my-cli”,该框架已完全开源,完整过程保存在GitHub仓库中。
专业办公:胜任真实工作任务
通过真实环境和算力联合强化学习(RL)扩展,Qwen3.8可在主流智能体框架中稳定交付生产级成果。示例包括:法务助理团队需一周完成的数百份法律文档标注,模型一小时内完成;篮球数据分析需逐帧标注160小时比赛录像,模型数十分钟拆解8400多个攻防回合并输出战术画像和教练报告;金融研究团队需数年积累才能完成的量化策略,模型连续工作数小时后交付完整ETF轮动策略并持续迭代。
长周期任务自适应
在数字芯片设计、商业模拟运营等长周期任务中,Qwen3.8能通过“执行-反馈-迭代”的自适应闭环,在数千轮超长程交互中实现算法与策略的深度重构。
视觉理解与多模态智能体
Qwen3.8能读懂200页财报PDF、理解超100小时长视频,并能将视觉信息反馈至工作全流程。在“应用复刻”基准RecreationBench中,模型无源代码、无法联网,仅通过交互与反馈理解应用,即可从零复刻整个应用,展现出混合多模态智能体能力。
基础设施适配
阿里真武M890超节点已成功适配Qwen3.8,通过芯片、云平台与模型的端到端优化,显著提升推理效率、降低推理成本,在Agentic推理场景中最多可实现1.5倍性能提升。
