AI算力成本飙升:上游涨价、中游承压,谁在承担Token账单?
2026/09/21 10:42阅读量 3
随着全球AI推理需求爆发式增长,HBM存储及GPU算力租赁价格大幅上涨,导致AI产业链成本结构发生剧烈变化。头部模型厂商凭借技术壁垒实现提价放量,掌握定价权;而处于中游的算力服务商面临“卖1元亏1.24元”的困境,利润空间被上游挤压殆尽。市场呈现两极分化,补贴退坡后的真实定价能力将成为检验企业生存的关键指标。
事件概述
近期,全球AI产业链出现显著的涨价潮。从上游芯片与存储供应商到中游算力租赁商,再到下游模型服务商,成本压力沿产业链层层传导。数据显示,2026年3月全国日均Token调用量已达140万亿,较2024年初增长千倍,推理支出首次超过训练支出,算力消耗从一次性投入转变为持续性运营开支。在此背景下,不同环节的企业因市场地位差异,对涨价账单呈现出截然不同的应对策略。
核心信息
1. 上游:产能瓶颈推高基础成本
- 存储紧缺: KB证券报告显示,三星和SK海力士的存储库存已不足10天。HBM4量产消耗大量晶圆,挤占通用DRAM产能,预计2027年存储占AI基建投资比例将升至57%-68%。
- 算力租赁涨价:
- Nebius(欧洲算力租赁商): 9月发出第二封调价函,10月起H100租金涨至4.50美元/小时(涨幅约17%),H200、B200、B300等高端卡涨幅在19%-21%之间,配套CPU和内存费率分别上调25%和41%。新签合同普遍要求三年预留期及30%-40%预付款,项目回收期缩短至22个月。
- 国内云厂商: 腾讯云年内第三次调价,企业旗舰版涨幅约154%;阿里云AI算力及存储产品最高涨价34%;美国CoreWeave全系SKU提价约25%。
2. 下游:市场裂变为“普惠”与“高端”两层
- 价格分化: 普惠层模型价格持续走低,2026年部分模型每百万Token仅需0.02元;而高端推理模型报价高达每百万Token 10-30元,头部API输出价格累计上涨80%。
- 智谱(Zhipu AI)案例: 通过连续提价(GLM-5系列多次上调,FlashX版本定价为上一版2.5倍),智谱实现了“提价放量”。截至2026年8月,其API定价同比提高101%,但MaaS平台调用量增长超40倍,用户突破740万,毛利率升至24.6%。这表明在技术确定性面前,客户愿意支付溢价,智谱掌握了较强的定价权。然而,其定价权受限于算力储备,曾因算力耗尽被迫停售主力产品。
3. 中游:算力服务商陷入结构性亏损
- 硅基流动(SiliconFlow)招股书数据: 揭示了中游服务商的艰难处境。2025年,该公司每卖出1元Token服务,直接成本高达1.24元。
- 毛利率恶化: 从2023年的83.3%降至2024年的39.4%,2025年进一步跌至-24.0%。公有云MaaS业务毛利率为-119%,即每收1元收入,直接成本超2元。
- 成本结构: 算力租赁成本占销售成本的86.9%。为拉新发放的免费Token代金券,对应的算力成本是当年全部收入的1.85倍。
- 财务状况: 2025年净亏损3.45亿元,经营现金流为负。尽管付费客户数两年内增长292倍至71.6万个,但增长无法掩盖单客亏损的结构问题。由于上游是大厂(如阿里),下游不敢轻易涨价,只能自行消化成本。
值得关注
- 定价权的验证: 当前许多低价源于大厂补贴。随着补贴退坡,真正的市场定价日尚未到来。投资者需关注硅基流动的毛利率能否转正、智谱的高定价能否持续转化为收入,以及大厂补贴停止的时间点。
- 产业链利润分配: 涨价红利主要流向拥有稀缺产能的上游(芯片、存储)和拥有技术壁垒的头部模型商(如智谱)。缺乏自有算力且无核心技术的中游服务商,面临被上下游挤压的生存危机,行业洗牌加速。
