大模型价格战白热化:Token均价跌破1美元,性价比取代单纯智能成为新竞争核心

2026/09/14 17:40阅读量 2

2026年第三季度,全球大模型行业陷入激烈的价格竞争,市场平均Token支付价格在三个月内腰斩,8月单月跌至0.97美元/百万Token。这一现象源于供需两端的变化:企业端因高昂API成本而限制预算并转向高性价比模型,供给端则通过发布Flash系列模型、优化缓存机制及强化后训练技术来降低推理成本。尽管“杰文斯效应”(即降价带来用量激增从而增加收入)在短期内显现失灵迹象,但随着通用模型能力突破进入具身智能等新场景,行业正从单纯的算力堆砌转向智能与成本的平衡博弈。

事件概述

2026年七至九月,全球大模型行业呈现“能力通胀、价格通缩”的显著特征。据Silicon Data数据显示,LLM Token支出指数在8月暴跌29%,降至0.97美元/百万Token,首次跌破1美元关口,较今年5月的2美元以上水平实现“腰斩”。OpenAI、Anthropic、谷歌以及国内智谱、阿里、DeepSeek、月之暗面等厂商密集发布新一代模型,定价策略全面转向极致性价比。

核心信息

1. 价格战升级:从补贴到结构性降本

  • 直接降价: OpenAI对GPT-5.6 Luna系列永久降价80%,并对旗舰模型GPT-5.6 Sol进行大幅折扣;DeepSeek将V4 Pro价格永久下调75%(虽随后因成本压力微调,但低价策略已定)。
  • Flash模型崛起: 厂商纷纷推出“Flash”版本作为日常主力,如智谱GLM-5.3-Flash、阿里Qwen3.8-Flash、月之暗面Kimi K2.8 Preview。这些模型以接近旗舰的性能和远低于旗舰的成本(如Qwen3.8-Flash训练开销仅为Plus版本的1/9),主打编码、Agent等高频办公场景。
  • 隐性优惠: 通过API接入编程或办公软件提供限时折扣、免费额度重置等方式变相降低用户获取门槛。

2. 技术驱动:后训练与架构优化重塑成本曲线

  • 缓存机制优化: Anthropic Claude Fable 5.1将KV Cache读取价格从1美元降至0.25美元/百万Token,降幅达75%。DeepSeek V4.1 Flash通过压缩KV缓存空间从源头降低存储成本。这主要得益于Agent场景中重复读取长上下文的特性。
  • 后训练重要性提升: 行业共识从“预训练决定底子”转向“后训练决定上限”。智谱GLM-5.3通过加大强化学习和长程任务反馈投入,使端到端任务完成率提升超50%。MiniMax指出,推理计算效率的提升倍数与后训练规模扩大基本线性相关,降低了研发边际成本。

3. 需求侧变化:企业预算收紧与开源替代

  • 企业成本痛点: Uber、Meta、Amazon等企业面临AI工具账单激增问题。Uber CTO透露工程师月均API调用成本高达500-2000美元,且AI使用量与实际业务产出难以量化挂钩。多家企业开始设置Token消耗上限,并转向更便宜的开源模型。
  • 估值逻辑转变: 高盛分析师指出,大模型行业进入下半场,竞争焦点由“技术可行性”转向“成本可承受性”。闭源API厂商若无法控制成本,将面临估值打折风险。

4. 市场影响:“杰文斯效应”短期失效与新场景探索

  • 收入增长受阻: OpenRouter数据显示,8月路由Token量环比增长47%,但美元支出仅微增7%。低价Flash模型占据新增调用大头,导致“用量涨、单价跌”,收入未能同步增长。摩根大通研究认为,若收入增长跟不上成本增长,将对AI基础设施投资构成利空。
  • 新希望:具身智能与通用能力突破: OpenAI发布的GPT-6 Astra展示了通用模型操控机械手、处理工程文件的能力,标志着模型开始具备“手脚”。这种智能泛化有望解锁新场景,进而带动新一轮用量爆发,修复“杰文斯悖论”的商业闭环。

值得关注

  • 定价权转移: 随着中美模型能力差距缩小,拥有更高性价比(尤其是开源或类开源高效模型)的中国厂商在国际市场上获得更强话语权。定价权正从“智能领先者”向“性价比最优者”滑动。
  • 过渡期特征: Token单价跌破1美元被视为智能与性价比博弈的过渡期。只有当新应用场景(如具身智能、复杂工作流)真正爆发,才能承接住价格下降带来的流量红利,实现可持续增长。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。