DeepSeek V4 Pro 正式版发布:Agent 能力大幅跃升,性价比仍是王牌
DeepSeek 于 8 月 13 日凌晨悄然上线 V4 Pro 正式版,架构不变但后训练大幅强化,Agent 相关基准测试分数暴涨,代码生成与工具调用能力明显提升。实测显示其可一次性生成完整可运行代码,但 thinking 模式易挤占输出空间。价格维持低位,同时官方已预告 API 即将涨价。
事件概述
DeepSeek V4 Pro 正式版于 8 月 13 日凌晨通过 API 文档更新悄然上线,距离 4 月 24 日预览版发布已过去 111 天。模型架构与预览版保持一致,仍为 1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文和 384K 最大输出,变化集中在后训练环节,Agent 能力提升显著。
核心信息
-
Agent 评测分数暴涨:DeepSWE 从预览版的 12.8 升至 62.7;Cybergym 从 52.7 升至 83.3;Terminal Bench 从 72.1 升至 87.9;DSBench-Hard 翻倍至 67.2。这些评测均涉及长链路代码修改、环境操作和工具调用,正是预览版薄弱之处。
-
API 价格未变:每百万 token 输入 3 元、输出 6 元,与预览版持平。但官方已于 8 月 6 日预告“近期整体上调 API 定价,预计涨幅较大”,当前窗口期可能有限。
-
实测表现:
- Boids 群体模拟任务:约 170 秒生成 761 行完整 HTML,一次运行通过,效果流畅。
- 模糊需求番茄钟面板:自主补全任务标签、专注统计、快捷键支持及 Web Audio 白噪音,共生成 1223 行代码。
- 寻路算法可视化:默认 thinking 模式下,16384 token 输出中有 13394 个用于思考,导致代码截断;关闭 thinking 后 54 秒生成完整 715 行代码。
-
天花板与短板:无工具 HLE 得分 42.7,低于 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3;NL2Repo 为 61.5,落后 Opus 4.8 的 69.7。在纯知识推理和最复杂软件工程任务上尚未登顶。
值得关注
DeepSeek 的核心竞争力仍是“比我强的没我便宜,比我便宜的没我强”——V4 Pro 价格约为 Fable 5 的十分之一、Kimi K3 的三分之一。此外,官方更新日志中提及“DeepSeek Harness 极简模式(即将发布)”,结合近期团队与招聘信息,DeepSeek 可能将模型与 Agent 运行框架打包推出,竞争正从“模型能力”转向“模型+工具链”的系统级比拼。
