Agent重塑AI基础设施:从被动承载到主动进化的范式转移
2026/10/01 11:21阅读量 2
随着AI进入Agent时代,传统云计算面临的负载模式发生根本性变化,Agent的高频并发调用与自我迭代对数据处理、推理服务及系统优化提出了全新挑战。阿里云在2026年云栖大会上提出“芯云模一体”战略,通过升级MaxCompute、PAI及Hologres等核心产品,打通从数据生产、模型训练到应用落地的全链路。基础设施的竞争焦点正从单纯的算力规模转向能否构建“数据-智能-进化”的反馈闭环,实现系统随业务负载自动优化。
事件概述
2026年10月1日,在云栖大会上,阿里云发布了针对Agent时代的AI基础设施升级方案。面对Agent(智能体)高频、并发、自主试错的运行特征,传统云平台“等待—反馈”的节奏已无法适应。阿里云提出“芯云模一体”协同设计理念,旨在通过提升模型生产效率、智能落地效率和系统自我进化效率,解决从原始数据到业务决策的全栈瓶颈。
核心信息
1. 数据层:应对多模态与高质量数据需求
具身智能和自动驾驶场景下,数据形态从文本转向视频、点云等多模态信号,数据清洗、标注和质检成为主要瓶颈。
- MaxCompute升级:实现CPU、GPU和大模型Token的统一调度,支持通过自然语言组织数据处理任务。
- EMR Serverless Spark:支持Spark、Ray、Daft等全模态引擎,连接Paimon、Iceberg等湖表格式。据阿里云数据,该方案可使具身智能数据处理耗时减少40%,PB级原始数据可直接生成LeRobot、RLDS格式训练集。
- PAI-DLC 3.0:引入Xfuse技术,联合分析算力底座、训练框架和任务状态,自动定位通信和资源调度问题,使多模态模型端到端训练速度提升2.4倍。
2. 应用层:构建Agentic Lake与安全治理体系
Agent不仅使用数据,更需理解数据语义并执行高风险操作,这对权限管理和推理稳定性提出新要求。
- OpenLake向Agentic Lake演进:通过Skill、MCP接口向Agent开放计算引擎,DataWorks提供跨引擎语义层和数据治理,确保Agent在可控沙箱中运行,支持可回滚、可审计的操作。
- ADA(AI原生大数据服务):采用多智能体协同架构,用户通过自然语言提问,系统自动调动离线计算、实时分析、搜索等不同引擎完成复杂任务。
- 推理基础设施优化:
- PAI-InferX:通过智能路由、Cache感知调度和KV Cache存储,处理Agent持续推理负载。
- Flink Streaming Agent:支持视频、音频和事件流的实时接入与理解,应用于央视体育实时AI解说等场景,具备动态编排和长中短期记忆能力。
3. 进化层:系统自我优化与反馈闭环
Agent产生的负载具有高度复杂性,人工调优难以覆盖所有变化,基础设施需具备自我观察和优化能力。
- PAI-CrystalLLM:利用不到1%的GPU资源模拟万卡集群训练效果,为大规模训练提供“风洞”测试环境。内部实践显示,其帮助训练任务带来2%至10%的MFU(有效算力利用率)绝对提升。
- Hologres自进化查询优化器:分析真实Workload,提炼候选优化方案并通过验证后沉淀至系统。数据显示,其在四个月内自主发现并完成28项优化,优化器性能提升100%,湖上查询性能提升38%。
- 行业案例:穹彻智能基于阿里云Data+AI Pipeline搭建云上流程,数据处理吞吐提升超十倍,模型训练效率提升约50%,将原本以周为单位的迭代周期大幅压缩。
值得关注
- 基础设施边界:尽管Agent能显著降低数据处理和模型试错成本,但在AI for Science等涉及物理世界操作的场景中,受限于科学软件接口老旧和实验设备自动化程度低,Agent尚难独立完成从计算到实验验证的完整闭环。
- 竞争焦点转移:AI基础设施的竞争关键已从“承载多少模型”转向“能否让数据、模型和系统一起更快进化”,即构建高效的“数据→智能→应用→新数据”飞轮。
- 安全与权限细化:随着Agent自主性增强,企业数据权限管理需从传统的“员工访问控制”细化至“Agent在特定任务下的数据调用范围及异常接管机制”。
