DeepSeek V4-Flash 实测:不到 3 元完成 5 个任务,大模型竞争转入「智价比」
2026/07/31 19:50阅读量 2
DeepSeek 正式发布 V4-Flash,API 调用将自动切换为 V4-Flash-0731。该版本模型结构与预览版一致,仅通过后训练提升推理、代码和工具调用能力,价格维持输入 1 元、输出 2 元/百万 token;同日 OpenAI 对 GPT-5.6 Luna、Terra 大幅降价。实测中,V4-Flash 用约 2.85 元完成了 5 个开发类任务,显示大模型竞争正从拼能力上限转向拼“智价比”。
事件概述
DeepSeek 正式发布 V4-Flash 模型,目前仅提供 API 使用,网页端和 App 未同步更新。开发者调用 deepseek-v4-flash 时,后台会自动切换至新版本 V4-Flash-0731。该版本与预览版的模型结构、尺寸完全一致,本次只重新进行了后训练(Post-Training),因此推理、代码与工具调用能力得到强化。
核心信息
- V4-Flash-0731 支持一次读取 100 万 token,可处理大份文档或完整代码项目;兼容 OpenAI Responses API,可接入 Codex。
- API 价格保持不变:输入每百万 token 1 元,输出每百万 token 2 元。
- 官方公布:Terminal Bench 2.1 得分从 61.8 升至 82.7;代码 Agent 测试 DeepSWE 从 7.3 升至 54.4。官方称能力“远超 V4-Pro-Preview”。
- 同一天,OpenAI 宣布大幅降价:上线仅 3 周的 GPT-5.6 Luna 输入、输出价格均下调约 80%,调后为每百万 token 输入 0.2 美元、输出 1.2 美元;Terra 降价 20%。
实测结果
测试方将 V4-Flash 接入自动化测试流程,过程中不追加提示、不人工修正,要求模型直接完成 5 个从简单到复杂的任务:
- 基于 320 篇早报文章数据生成交互式 HTML 分析报告,含账号对比、阅读趋势、互动画像、选题分析和爆款榜单等模块。
- 编写单文件 HTML 打砖块游戏,实现弹性碰撞、动量传递、重力、砖块耐久、四种道具和粒子效果。
- 编写三体轨道模拟器,采用 RK4 积分算法,支持调整引力常数、质量、位置与速度,并提供稳定轨道预设。
- 设计科幻控制舱仪表盘,包含实时波形、环形进度、滚动日志和“超载模式”警报交互。
- 编写 Python 脚本调用 GitHub API,拉取过去 7 天 Stars 增长最快的 10 个开源 AI 项目,自动生成 Markdown 周报并输出为网页。
最终 5 个任务均拿到可运行交付物。测试方共记录 393 次 API 请求,累计消耗约 3422 万 token,总费用仅 2.85 元。
趋势判断
V4-Flash 此次升级没有改变模型结构,仅靠后训练便显著提升了连续任务执行能力。这说明在继续堆参数之外,数据质量、强化学习和推理策略仍能从现有模型中挖掘更多能力。顶级模型的竞争正从单纯比拼能力上限,转向同时争夺“智价比”;对开发者和用户而言,调用成本下降意味着 Agent 可以承担更多次调用、更长时间运行,并落地过去因成本过高而无法执行的任务。
