腾讯发布混元 Hy4 preview:参数跃升与长程 Agent 能力实测
2026/08/29 13:58阅读量 2
8月28日,腾讯开源新一代大模型混元 Hy4 preview,总参数量增至770B,上下文窗口扩展至1M,并同步接入WorkBuddy、元宝等产品。实测显示,该模型在复杂费用审核、原生Canvas游戏开发及Three.js 3D场景构建中,展现出从需求拆解、代码生成到自我测试修复的完整长程执行链路。尽管存在细节瑕疵,但其“发现问题-迭代修复”的能力标志着向生产力Agent迈出的关键一步。
事件概述
2026年8月28日,腾讯正式发布并开源新一代大模型混元 Hy4 preview。作为继Hy3之后的迭代版本,Hy4 preview在架构规模、上下文能力及性价比上均有显著提升,旨在验证腾讯在AI领域的持续投入能否转化为实际的生产力工具价值。
核心信息
1. 模型规格与商业化策略
- 参数规模:总参数量从上一代的295B提升至770B,激活参数从21B增至49B。
- 上下文长度:支持从256K扩展至1M (100万) tokens。
- 部署渠道:已同步接入腾讯内部产品(WorkBuddy、CodeBuddy、元宝、ima),并通过腾讯云TokenHub及OpenRouter开放API调用。
- 定价策略:延续高性价比路线,输入价格6元/百万tokens,输出18元/百万tokens,缓存命中0.3元/百万tokens。
- 性能优化:通过优化训练方法、数据策略及底层算子,推理吞吐较基线提升31.8%。
2. 基准测试表现
腾讯组织163名专家对203个工程任务进行盲测,Hy4 preview平均得分2.99/4,略高于竞品Kimi K3 (2.94) 和 GLM 5.3 (2.92)。优化重点聚焦于软件工程、办公分析、游戏开发及科学研究等需要长工作链的生产力场景。
3. 实战能力实测
为评估其在真实复杂任务中的表现,测试涵盖以下三个维度:
A. 复杂办公场景:多源材料交叉核验
- 任务:审核包含6笔申请、两版制度、预算台账及审批邮件的费用包。
- 结果:模型用时3分27秒完成审核,准确识别金额计算错误(如超标餐叙、酒店上限)及逻辑漏洞(如未获IT批准的软件订阅)。具备跨文档证据链拼接能力(如通过邮件时间戳佐证交通费合理性)。
- 局限:在制度版本适用性判断上出现细微偏差(将早期申请误归入新制度),虽未影响最终金额结论,但提示关键前提仍需人工复核。
B. 前端工程:原生Canvas游戏开发
- 任务:仅使用HTML5 Canvas和TypeScript,从零开发《深海进化论》大鱼吃小鱼游戏。
- 结果:32分钟内交付可运行项目,包含完整的游戏循环、碰撞判定、UI交互及本地最高分功能。
- 自测与修复:模型内置了15项Node逻辑测试和14项浏览器端到端测试。在自测中发现并修复了边界渲染异常及鼠标控制手感Bug(如追击间隙问题),展现了“生成-测试-修复”的闭环能力。
C. 3D应用:Three.js竞速游戏构建
- 任务:制作雨夜集装箱港口背景的无人机竞速游戏《午夜港口》,含AI对手、氮气加速及实时排名。
- 结果:首次交付因依赖本地服务器导致白屏,反馈后20分钟内重构为单文件可执行版本。开发过程中通过模拟测试发现并修复了AI路径预测、圈数累计及渲染过曝(UnrealBloom参数调整)等问题。
- 意义:证明了模型在复杂项目中定位上下文、承接错误并持续推进迭代的长程Agent潜力。
值得关注
- 从“生成答案”到“执行任务”:Hy4 preview的核心突破不在于单次回答的正确率,而在于面对报错、冲突或交付失败时,能够基于已有结果进行调试和迭代,而非推倒重来。这种长程执行能力更接近自动化Agent的定义。
- 商业回报验证:腾讯二季度AI业务对Non-IFRS经营利润产生约105亿元净影响。Hy4 preview的低定价策略旨在降低使用门槛,扩大API调用量,以证明算力投入能转化为真实的用户粘性和商业回报。
- 人机协作边界:尽管模型能承担更长的执行链,但在最终验收环节,尤其是涉及关键合规性或复杂逻辑判断时,仍需人类介入复核。
