WAIC 2026复盘:AI Infra从拼规模到拼效率,Token工厂与Agent成核心命题
WAIC 2026上,8位AI Infra高管一致认为行业已从拼算力规模转向拼推理效率与成本。Token调用量同比暴涨300倍,推理占企业AI计算支出超65%。Agent成为Token消耗主力,AI工厂与Token工厂概念兴起,效率竞争成为新焦点,不同背景玩家加速分层。
行业共识:从拼规模到拼效率
WAIC 2026上,8位AI Infra公司高管均指出行业关注点已从千卡集群、GPU性能转向如何稳定、低成本批量产出Token,并支撑Agent和AI应用持续运行。市场数据印证这一转变:2025年全市场Token调用量同比增长300倍,头部大模型企业增长由API和Token调用拉动。据Gartner测算,推理已占企业AI计算支出的65%以上。
- 九章云极市场部负责人陈庶:去年讨论如何训练模型,今年转向如何让模型规模化跑起来。
- 首都在线COO董直烨:关注点从“算力资源有无和规模大小”转向“算力落地效率与价值确定性”。
- 并行科技董事长陈健:2026年是AI大规模商业化元年,推理才是算力消耗长期主体。
Agent驱动Token消耗指数级增长
Agent正在推动AI从“生成内容”走向“完成内容”,单次任务可调动多个模型和工具,Token消耗量远超传统单轮问答。PPIO创始人兼CEO姚欣判断:未来99%的Token将由Agent消耗。
- 趋境科技创始人兼CEO艾智远:未来AI基础设施竞争不单是单点性能,而是复杂任务中的连续稳定服务能力。
- 博大数据董事长余武旺:未来竞争拼的是整个系统协同能力,包括网络、互联、能源、调度及快速响应能力。
AI工厂与Token工厂:一体两面
AI工厂涵盖数据处理、训练、微调、推理到应用交付全流程;Token工厂聚焦推理侧,将算力转化为标准化Token产能。二者非对立,而是共生关系。
- 董直烨:AI工厂更宽泛,Token工厂更侧重推理效率和确定性。
- 清程极智联合创始人师天麾:Token工厂可理解为AI工厂在推理时代、尤其大规模Agent场景下的具体运营形态。
- 陈健:AI工厂分训练工厂和推理工厂,推理工厂即Token工厂。长期看,推理算力需求将占85%以上;集群设计逻辑也截然不同:训练容忍网络波动但不能容忍单点故障,Token推理容忍单点故障但无法接受网络不稳定。Token工厂是AI工厂当下的价值核心。
后Scaling时代:效率为王
单纯堆算力边际效益递减,行业进入“后Scaling”阶段。但Scaling并未结束,而是转向更精细的系统、效率、调度Scaling。
- 付智(共绩科技创始人兼CEO):效率竞争分三层:计算效率(芯片/网络/框架优化)、资源效率(弹性调度/异构整合)、能源效率(匹配能源条件降低Token成本)。
- 艾智远:企业现实考量单位资源产出、有效利用率、成本是否能支撑长期使用。
- 姚欣:绝大多数Token工厂目前处于亏损状态,需完成从能源到应用的全栈优化才能实现可观毛利率。
玩家加速分层
陈健判断,Token工厂赛道玩家正在加速分层:
- 具备万卡GPU集群和全栈调度优化能力的算力服务商:优化后集群TPS和单位算力Token吞吐可拉开中小玩家10倍差距,但重资产模式扩张周期长。
- 自研大模型厂商自建推理集群:深度贴合自有模型架构,但硬件不对外开放,无法承接第三方需求。
- 中小算力服务商和初创团队:灵活但缺稳定大客户订单、缺GPU锁货渠道、缺底层优化能力,Token效率与头部有10倍级差距。
稳定大客户订单、强GPU供给、顶尖性能优化能力三者缺一不可。具备优势的头部玩家将持续收割份额,中小玩家生存空间持续收窄。
竞争关键:全链路效率与确定性
多位高管认为,AI Infra竞争已从资源竞争转向系统效率竞争,核心是让单位算力、单位能耗、单位成本产出更多有用Token,并稳定交付。对于Agent场景,还需关注长期任务成功率、单位任务成本和服务稳定性。
- 师天麾:模型、推理引擎、评测、路由与应用负载之间能否协同优化,决定基础设施最终真实产出。
- 董直烨:竞争关键三方面:算力转化效率(集群调度与推理引擎优化)、网络传输效率(低延迟与稳定性)、运营调度效率(动态匹配算力与模型)。
- 姚欣:不能只盯着Token生产数量,更要关注Token的智能含量和毛利率,需从底层能源到上层应用全栈优化。
