Qwen3.8-27B开源:270亿参数消费级显卡可跑,代码与Agent多项评测超过Claude Opus 4.6 Max

2026/08/15 14:05阅读量 3

Qwen3.8-27B正式开源,总参数270亿,支持原生多模态、262K Token原生上下文并扩展至100万Token。其在SWE-bench Pro、QwenSWEBench、OSWorld等代码/Agent评测中超过Claude Opus 4.6 Max,经量化后可在24GB显存消费级显卡本地运行,并支持推理深度按需调节。

事件概述

Qwen3.8-27B 正式开源,总参数 270 亿,主打编程、专业工作、研究及长程 Agent 任务。模型原生支持多模态,可看图、读 PDF、理解图表和处理视频;原生上下文 262K Token,最高可扩展至 100 万 Token。经量化后,24GB 显存的 RTX 3090/4090 等消费级显卡有机会整卡部署。

核心信息

  • 代码与 Agent 评测:SWE-bench Pro 中,27B 比 Claude Opus 4.6 Max 高 8.3 分;QwenSWEBench 中领先幅度扩大到 15.2 分。
  • 专业长任务 Agent:CoWorkBench 得分 70.7,超过 Opus 4.6 Max 的 68.2。
  • 计算机/手机/浏览器操作:OSWorld-Verified 84.3 分,Claude Opus 4.6 Max 72.7 分;AndroidWorld 81.9 分,Claude Opus 4.6 Max 62.0 分;WebArena-Verified 从上一代 48.8 提升到 64.8。
  • 多模态推理:视觉数学问题解决能力在开启 CI 后为 94.6;通用视觉推理开启 CI 后为 85.6,未开启时为 65.7。
  • 架构:模型共 64 层,其中 48 层采用 Gated DeltaNet 线性注意力,16 层保留完整 Attention,基本按“三层线性注意力 + 一层完整 Attention”循环,以降低长序列计算和缓存压力。
  • 推理控制:默认开启 Thinking 模式,支持通过 reasoning_effort 在 xhigh、medium、low 三档之间调节推理深度,也可完全关闭;同时默认启用 preserve_thinking,将 Agent 前几轮的思考保留在后续上下文中。
  • 部署支持:已接入 Transformers、vLLM、SGLang 和 TokenSpeed;生产高吞吐场景推荐 SGLang、vLLM,Hugging Face 提供量化版本入口。

社区实测

有开发者用 Qwen3.8-27B-FP8 在单张 NVIDIA GH200 上并发运行 10 个真实请求,每个请求最高输出 16K Token,上下文拉满到 262K,首批流式 Token 基本在 10ms 内返回,10 个请求全部正常完成。

另有用户在单张 GPU 上让模型分析一部 1935 年的 11 分钟电影,要求识别 96 个带时间戳的事件并引用画面文字,最终 157 秒完成,时间点误差约 2 秒。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。