DeepSeek V4 Flash 单日消耗 8 万亿 Token,划出大模型“斩杀线”
DeepSeek V4 Flash 正式版在 OpenCode 平台单日消耗 8 万亿 Token,超过 OpenRouter 全平台日均规模。该模型以极低 API 价格提供接近旗舰模型的 Agent 与编码能力,使高价模型面临“几分性能领先是否值几十倍价格”的拷问。
事件概述
DeepSeek V4 Flash 正式版发布后,在一款 AI 编程工具 OpenCode 上单日消耗了 8 万亿 Token,其中 5 万亿来自免费额度,3 万亿来自付费套餐。作为对比,接入 400 多款模型的大模型路由平台 OpenRouter,日均处理量约为 6.6 万亿 Token。
这一消耗量直接源于 V4 Flash 的低价与 Agent 任务爆发:模型写出的代码未必更多,但一次长任务会反复调用工具、试错重试,Token 消耗可能翻几十倍甚至几百倍。
核心信息
价格与性能的“斩杀线”
- V4 Flash 每百万输出 Token 定价 2 元人民币,而 Anthropic Claude Opus 4.8 为 25 美元(约 170 元),价差约 85 倍。
- 在 Artificial Analysis 的 Intelligence Index v4.1 中,V4 Flash Max 得分 50,调用费约 72.02 美元;Claude Opus 4.8 Max 得分 56,调用费约 3752.55 美元。后者多拿 6 分,费用高出约 52 倍。
- 在 Arena 前端编码榜单中,V4 Flash 被列入“价格—性能”前沿模型,初步排名曾暂列 Opus 4.8 Thinking 之前。
- 国内其他模型的输出定价(每百万 Token):Qwen 3.8 Max 36 元、GLM 5.2 28 元、Kimi K3 100 元,DeepSeek 明显更低。
低成本背后的架构
V4 Flash 总参数 2840 亿,每个 Token 仅激活约 130 亿参数。其 Transformer 模块改造了注意力层,采用 CSA(先压缩再找重点)与 HCA(极致压缩但全部浏览)两种机制交错排列;前馈层沿用 DeepSeekMoE,只路由到部分专家。同时使用低精度权重和长上下文缓存优化。据 DeepSeek 此前公开的技术报告估算,在百万 Token 上下文下,V4 Flash 单 Token 推理计算量约为 V3.2 的 10%,KV Cache 约为 7%。
Agent 能力来自后训练
正式版与 Preview 版结构和尺寸相同,仅重新进行后训练。后训练流程包括训练数学、代码、Agent 与指令遵循专家,用 SFT 和 GRPO 强化,再通过多个教师模型的 On-Policy Distillation 合并。DeepSeek 还设计了专门工具调用格式,用 Interleaved Thinking 保留推理状态,并用 DSec 提供数十万并发沙箱让模型练习运行代码、读报错、继续修改。V4 Flash 在 Terminal Bench 2.1 上得分 82.7。
本地部署门槛降低
V4 Flash 权重文件合计约 167GB。社区项目 DwarfStar 通过低比特量化,将 q2 版本放入 96GB 或 128GB 统一内存设备,q4 版本建议至少 256GB 内存;部分 128GB Mac 测试中,短上下文速度可达每秒二十多 Token。但极低比特量化可能损伤代码、长上下文和工具调用能力,社区运行时仍处于早期阶段。
值得关注
V4 Flash 不需要成为最强模型,它只要达到“大多数时候可以做完”,就能用近两个数量级的价格差,把更贵的模型挤出默认调用位。受冲击最明显的是中间层模型:它们性能略强但价格贵几十倍,又没有强到能稳定解决 V4 Flash 做不了的问题。
模型竞争维度正在从“单次回答有多聪明”转向“完成长任务的花费、时长和失败率”。OpenAI 高管也曾表示,模型会产生极大使用量,因此不需要依靠极高毛利承担训练成本;只要调用量足够大,累计利润仍可覆盖下一代模型训练成本。
