DeepSeek测试V4.1 Flash模型:以更低成本与延迟挑战Pro版地位

2026/09/09 15:56阅读量 2

DeepSeek开启V4.1 Flash中间版本的内测,并同步下调Flash系列价格,旨在通过提升“智能密度”将日常及中等复杂度负载从昂贵的Pro版迁移至更廉价的Flash版。此次调整标志着行业竞争焦点从单纯的能力上限转向单位成本与延迟下的效率优化,特别是针对Agent工作量的经济性考量。

事件概述

DeepSeek近期开放了V4.1 Flash中间版本(Checkpoint)的内部短周期测试,并在反馈表中询问用户该模型是否能全面替代在线运行的V4 Pro版本。与此同时,公司宣布将于北京时间9月10日中午正式下调Flash系列模型的价格。这一组合动作反映了AI行业竞争重心的转移:从追求原始能力的极致,转向在更低成本和延迟下提供更高“智能密度”的解决方案,以适配日常应用和Agent(智能体)工作负载。

核心信息

1. V4.1 Flash内测细节

  • 版本特性:该中间版本采用新结构,原生支持多模态,并在能力、速度和成本方面较之前的Flash构建有所提升。
  • 测试限制:模型名称有效期至9月10日,每个账户限制20个并发请求。测试期间费率与现有V4 Flash保持一致。
  • 初步反馈:早期开发者报告指出,在代码生成和检索任务中,生成速度有显著提升。

2. Flash系列价格大幅下调
自9月10日中午起,Flash系列(包括主模型和视觉实验变体)执行新定价策略,峰值价格为非峰值的两倍:

  • 缓存命中输入(Cache-hit input):0.02元/百万token(降幅达60%)。
  • 缓存未命中输入(Cache-miss input):1元/百万token。
  • 输出(Output):4元/百万token。

此前,Flash与Pro之间存在显著价差,例如在峰值时期,Flash输出为9元/百万token,而Pro价格更高。开发者通常愿意为高难度任务支付溢价,但现在的目标是让更快、更强的Flash吸收更多日常和中复杂度负载,从而释放Pro版用于真正困难的长程任务。

战略分析:智能密度与Agent经济

智能密度(Intelligence Density)
DeepSeek强调的核心概念是“智能密度”,即如何在更少的Token消耗和更短的墙钟时间(Wall-clock time)内获得同等质量的结果。相比延长思维链以提高准确率,更高效地利用计算资源能同时改善用户体验和单位经济效益。

Agent工作量的经济性挑战
对于Agent工作负载,单次用户请求可能触发多次模型调用(读取文件、调用工具、检查结果等)。如果步骤数量倍增,仅降低单Token价格不足以降低整体任务成本。因此,框架层面的优化——如让模型发出更长的工具使用程序、跨步骤保留推理状态、避免重复处理已检查材料——变得与模型权重本身同样重要。DeepSeek开源的Harness项目正是处于这一层,负责提供工具、会话状态和执行环境。

未来竞争轴心
当中间层级模型以极低成本接近前代旗舰的实用性能时,旗舰模型必须通过完成更长周期、更高风险的Agentic工作来证明其价值。未来的竞争不再仅仅是基准测试分数,而是能否在多小时甚至多天的Agent工作中得出可验证的结论。若V4.1 Flash最终能承载大量当前路由至Pro的工作负载,DeepSeek可将流量推向更便宜的层级,并将研发和服务能力集中在更难的问题上。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。