AI大模型“斩杀线”持续上移:Agent放大成本与能力差距

2026/08/05 10:05阅读量 3

2026年7月31日DeepSeek发布V4 Flash 0731,在Artificial Analysis Intelligence Index上得分50,高于自家V4 Pro,并以明显更低的单任务成本压过降价80%的GPT-5.6 Luna。随着Agent成为主流使用方式,模型竞争从对话跑分转向任务维度的综合性价比,能力与成本差距被成倍放大,“斩杀线”持续上移。

事件概述

2026年7月31日,DeepSeek发布V4 Flash 0731。新版在Artificial Analysis的Intelligence Index上得50分,比上一版高10分,也超过DeepSeek V4 Pro (max)的44分。将各模型按能力得分与每任务成本放入散点图,V4 Flash 0731落在左上角;在其右下方区域,模型成本更高、能力更弱。AI圈称之为“斩杀线”(英文称Kill Zone),落入其中的模型会快速失去市场竞争力。

Agent重新定义竞争维度

Agent成为主流使用方式后,模型交付的是完整任务,而并非单次回答。单轮对话的准确性无法反映Agent任务的实际效果,按token计价的测试也不能准确衡量任务支出。

  • 2026年5月,NIST下属的CAISI对比DeepSeek V4 Pro与GPT-5.4 mini,在7个基准上实际支出从便宜53%到贵41%,说明成本随任务类型变化。
  • Intelligence Index v4.1的权重向Agent任务倾斜:Agents占比34%,Coding占24%,Scientific Reasoning占24%,General占18%;横轴“每任务成本”按五类token计价后除以任务总数。
  • 按该口径,Claude Opus 4.8 (max)得56分、每任务成本1.78美元;DeepSeek V4 Pro (max)得44分、0.04美元;V4 Flash 0731得50分。
  • 能力与V4 Flash 0731最接近的GPT-5.6 Luna (max)得分51分,7月30日降价80%后,V4 Flash 0731的每任务成本仍低约60%。

Agent放大成本与能力差距

一项Agent任务的tokens消耗量比单轮问答高出多个数量级,模型单价差距不变,最终支出差额会被放大。2026年4月Bai Longju等人的论文显示,Agent编码任务的tokens消耗约为代码问答和代码推理的1000倍。Claude Opus 4.8的输出价格是每百万tokens 25美元,DeepSeek V4 Flash为0.28美元;单轮问答的支出差距以美分计,而在Intelligence Index任务上,两者差距接近1.7美元。

Agent任务步骤更长,任一步骤出错都会导致整体失败,成功率约等于各步成功率的乘积。一次回答准确率95%与90%的模型,在20步任务后成功率分别约36%与12%,差距从5个百分点扩大为近3倍。重试机制还会让能力不足直接转化为额外tokens支出。

模型能力已不足以单独决定结果。Reddit上的一项独立评测将DeepSeek V4 Flash接入Pi、OpenCode、Claude Code、Nanocoder四个Agent框架执行同一批bug修复,能力得分落在同一区间,但tokens消耗和耗时相差四倍。Artificial Analysis自建并开源了统一Agent测试框架Stirrup;V4 Flash 0731在Terminal-Bench 2.1上使用Stirrup得79%,使用DeepSeek自家Harness得82.7%。

毒圈缩圈:没有第二名

大模型切换成本极低,API调用标准化、MCP协议开放,开发者可以快速更换底层模型。基础模型层的进步放缓,同质化竞争加剧,市场份额会向性价比更优者快速聚集,而不是按比例分配。

成本下降无法带来利润,因为降本很快被传导为降价。2026年7月30日OpenAI将GPT-5.6 Luna价格下调80%、GPT-5.6 Terra下调20%;次日DeepSeek发布V4 Flash 0731。不跟进降价就要交出市场份额。OpenAI披露的数据显示,算力从0.2吉瓦增至1.9吉瓦(9.5倍),收入从20亿美元增至200亿美元以上(10倍),投入和产出几乎线性对应,没有形成额外的单位效率优势。

价格战通常要打到成本线才会停止。2026年5月23日,DeepSeek将V4 Pro API价格永久降至原定价的四分之一,此后每百万tokens输入(缓存命中)0.025元、输入(缓存未命中)3元、输出6元,当时报道称创全球大模型价格新低。V4系列通过混合注意力架构与多token预测,单token推理浮点运算量降至前代的27%,KV缓存降至前代的10%。Gartner预测,到2030年大模型推理成本将比2025年降低超过90%。路透社7月还报道,DeepSeek正在研发专用于推理的自研芯片,项目启动约一年;OpenAI、Anthropic等也有自研芯片计划。

V4 Flash 0731的架构与尺寸未变,仅重做后训练,Intelligence Index得分就从40升至50。模型迭代、自研芯片、自建算力与系统工程投入,都会继续推高“斩杀线”。

结论

“斩杀线”和“毒圈”这两个来自游戏的词,同时在中英文AI圈流行,反映出大模型竞争已经进入生死局:一旦落入斩杀范围,几乎没有过渡地带;留在场内的玩家则面临越来越快的淘汰压力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。