AI下半场核心转向:腾讯阿里字节为何集体构建Agent“环境”?

2026/09/17 21:05阅读量 3

随着预训练收益放缓,腾讯、阿里、字节等头部大厂正系统性地将重心转向Agent训练环境的构建(Environment Scaling),认为高质量交互环境是决定模型能力边界的关键变量。近期多项研究及资本动作显示,环境建设已从分散探索走向系统化工程,面临极高的筛选淘汰率与持续进化的挑战。这一趋势标志着AI应用从单纯解决既定问题,向定义复杂真实场景问题的深层转变。

事件概述

当前AI行业共识逐渐形成:在预训练阶段收益边际递减的背景下,“环境”(Environment)成为驱动Agent能力增长的下一个核心Scaling Law变量。腾讯、阿里、字节跳动及海外OpenAI、Anthropic等机构均在加速构建Agent所需的交互式训练世界。这不仅是技术路线的调整,更被视为AI下半场从“解决问题”转向“定义问题”的基础设施布局。

核心信息与技术进展

1. 腾讯混元:多团队并行构建系统化环境

  • 组织调整:腾讯将“强化学习及Agent能力”明确纳入基础模型部职责,由首席AI科学家姚顺雨统一负责,显示出对环境建设的系统性重视。
  • 研究成果:2024年4月至9月期间,混元至少4个研究团队发布了6篇关于环境的论文,累计署名76人次。主要方向包括:
    • 长时任务:推出Long-Horizon-Terminal-Bench,通过递归生成超3.7万个长程终端任务,平均成本降至5美分/任务。
    • 移动端环境:发布HyMobileAgent,搭建包含34个模拟App、超3.4万项任务的PhoneWorld,实现环境与数据协同扩展。
    • 环境进化:发表《Environment Evolution for Terminal Agents》,不再从零生成环境,而是让现有环境随模型能力升级而动态演化,解决训练信号衰减问题。
    • 闭环管线:8月发布UI-Mate,将任务生成、沙箱搭建与验证器连接,接入在线强化学习流水线。

2. 阿里通义:提出“Environment Scaling”概念并布局资本

  • 学术定义:阿里通义联合浙江大学、北京大学发表ACL 2026论文《Towards General Agentic Intelligence via Environment Scaling》,正式命名该新变量,指出训练环境越丰富,Agent处理工具和任务的能力越强。
  • 资本动作:据报道,阿里洽谈领投AI训练与评测公司UniPat AI新一轮融资,规模约3亿美元,对应估值约25亿美元。UniPat提供Terminal-X等一体化基建系统,涵盖任务设计、沙箱环境与评测标准。

3. 行业共性挑战:质量稀缺与时效性瓶颈

  • 极高淘汰率:腾讯混元团队从Hugging Face和GitHub收集的47,678个公开终端环境中,经质量、可解性和难度筛选后,仅保留127个,淘汰率达99.7%。
  • 数据污染与幻觉:OpenAI审计SWE-Bench Pro发现约30%的公开任务存在测试过严、提示不完整等问题;Anthropic实验显示,仅调整CPU/内存资源配置,同一任务得分可相差6个百分点。
  • 环境保质期:静态环境易被模型“刷透”,导致有效学习信号减少。因此,环境需具备随模型能力进化的特性,如字节Seed团队的Agent-World已根据Agent能力缺口自动生成新任务。

值得关注:基础设施商业化与生态壁垒

  • 新兴商业模式:围绕“造环境”正在形成新的基础设施生意。例如,Deeptune通过复刻Salesforce、Slack等真实软件环境提供“Agent健身房”,并在获得a16z投资后被Mercor收购,体现了“环境构建+专家裁判标准”的结合趋势。
  • 大厂自建 vs 外包困境:由于环境直接关联后训练效果,且运行需要庞大的沙箱隔离与高并发重置能力,头部模型厂商难以完全外包核心环境,必须依托自有云基础设施自建。这导致赛道狭窄,既懂模型又懂底层调度的企业占据优势。
  • 安全执行环境:除了训练环境,Agent进入实际业务还需配套的安全沙箱、权限管控及追溯机制,周靖人指出这些执行环境基础设施必须同步补齐。

结论

AI行业的竞争焦点正从算力与数据规模,延伸至对真实世界复杂性的模拟能力。高质量、可进化、低噪声的Agent训练环境已成为稀缺资源,其建设水平将直接决定通用智能(AGI)落地的深度与广度。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。