腾讯混元Hy4预览版发布:127天实现能力跃升,构建“实战-反馈”闭环加速迭代

2026/08/29 12:46阅读量 3

8月28日,腾讯混元发布并开源Hy4 preview版本,总参数达770B,激活参数提升至49B,上下文窗口扩展至1M。自今年2月重建基建以来,混元将大版本迭代周期压缩至约两个月,在软件工程基准DeepSWE上得分超越DeepSeek V4 Pro,与Claude Opus 5持平。其核心加速逻辑在于建立“发布-实战-反馈-再训练”的闭环机制,通过WorkBuddy等产品矩阵收集真实用户与专家反馈,并首次让模型参与自身推理系统的优化,推动AI研发从“AI for Coding”向“AI for AI”演进。

事件概述

2026年8月28日,腾讯混元正式发布并开源了Hy4 preview版本。这是自今年2月腾讯启动预训练与强化学习基建重建以来,混元团队在127天内完成的重大版本迭代。此次更新不仅大幅提升了模型规模与性能,更标志着腾讯在大模型研发模式上从单纯依赖算力堆叠,转向以“实战反馈”为核心的系统化加速迭代。

核心信息与技术指标

  • 模型规格升级

    • Hy4 preview总参数量达到770B,是上一代Hy3的2.6倍。
    • 激活参数从21B提升至49B
    • 上下文窗口从256K扩展至1M(100万token)。
  • 性能表现对比

    • 软件工程能力:在DeepSWE基准测试中,Hy4 preview获得64.3分,超过DeepSeek V4 Pro的62.7分;相比之下,同期Hy3 preview为28.0分,而Claude Opus 4.8为58.0分。
    • 终端任务能力:在Terminal-Bench 2.1测试中,Hy4 preview获得85.4分,与Claude Opus 5持平。
    • 错误率降低:回顾Hy3正式版相比Preview版的改进,幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮对话问题率从17.4%降至7.9%。

加速迭代的三大支柱

1. “Preview-first”实战机制

混元延续了类似OpenAI的“迭代式部署”策略,通过提前发布Preview版本进入真实生产环境获取反馈。

  • 数据回流:Hy3 Preview期间,模型接入元宝、WorkBuddy、CodeBuddy、ima及QQ等50多个业务场景。这些真实使用场景产生的模糊提问、多轮追问及失败案例,被转化为高质量的后训练数据。
  • Co-Design体系:区别于普通用户仅能判断结果好坏,混元引入了金融、安全、软件工程等领域的专家共建机制。专家提供“什么才算真正做好”的质量标准,结合用户的实际Prompt分布,形成多维度的反馈闭环。

2. 产品矩阵作为训练场

腾讯内部拥有庞大的Agent产品矩阵,为混元提供了多样化的测试与训练环境。

  • WorkBuddy的作用:该工具集成了多家厂商的模型供用户切换选择。数据显示,接入Hy3正式版后,WorkBuddy内部测评的任务成功率从72%提升至90%,平均耗时缩短34%。主动选择Hy3的用户数量增长了6倍,甚至导致算力一度打满。
  • 能力迁移:不同产品提供不同维度的能力训练。例如,元宝锻炼信源判断,CodeBuddy锻炼规划与调试,企业微信和腾讯会议提供协作上下文。这种多环境下的能力习得具有可迁移性,使模型能更好地应对复杂的生产力任务。

3. 模型参与研发(AI for AI)

Hy4 preview的一个显著突破是模型开始参与自身的研发优化过程,即“把实战闭环搬进模型内部”。

  • 推理系统优化:Hy4 preview首次对自身推理系统进行优化,通过分析瓶颈、提出算子融合与通信优化方案并运行实验,最终使端到端吞吐相对基线提升31.8%,且在不同并发度下保持稳定收益。
  • 自动化实验:在后训练任务中,Hy4 preview作为研究者协调多个Codex Session并行优化评测目标,在8项评测中均优于独立探索的Codex。这标志着模型从被动执行者转变为研发参与者,缩短了从假设到验证的距离。

值得关注

腾讯混元的快速追赶并非仅靠单一模型的参数增长,而是构建了一个由**“发布、实战、反馈、再训练”**组成的持续运转系统。随着竞争焦点从算力转向谁能更高效地组织用户、专家、产品与模型形成反馈链,以及谁能利用模型自身优化研发流程,混元展示的这套系统化迭代能力,可能成为后续大模型竞争的关键分水岭。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。