DeepSeek V4 系列更新:架构未变,重新后训练提升 Agent 能力
2026/07/31 17:16阅读量 6
DeepSeek 发布 DeepSeek-V4-Flash 正式版,目前仅 API 端公测。新版与 Preview 采用相同结构和参数规模,仅重新进行后训练,并在官方 Agent 基准上取得明显提升,同时原生支持 Responses API 并适配 Codex。
事件概述
DeepSeek 更新了 DeepSeek-V4-Flash,官方称为“正式版”,但目前仅在 API 端公测。此次更新仅涉及 deepseek-v4-flash,V4-Pro API 以及 App 和网页端当前使用的模型均未同步更新。
更值得关注的是,DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用相同的模型结构和参数规模,只重新进行了后训练。
核心信息
- 架构未变,能力提升来自后训练:此次没有重新设计模型架构,也没有扩大参数规模,而是在原有模型上重新进行后训练。模型结构不变,但内部权重和行为方式发生变化。DeepSeek 未公布后训练具体使用了哪些数据、奖励方法和训练流程。
- Agent 能力是提升重点:新版 V4-Flash 在 Terminal Bench 2.1 上获得 82.7,在 DeepSWE 上获得 54.4,在 DSBench-FullStack 上获得 68.7。这些测试不同于传统代码补全,要求模型读取文件、理解代码仓库、调用终端、修改程序、运行测试并处理报错,需连续完成多步骤任务。
- 成绩需谨慎解读:DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用较高推理档位;DSBench-FullStack 和 DSBench-Hard 为 DeepSeek 内部测试集。因此,这代表其在官方 Agent 运行环境中的表现,第三方框架中的实际表现仍需独立测试验证。
- 接口与运行环境同步升级:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行适配。Responses API 是一套更适合 Agent 的通信接口,可统一处理模型回复、推理状态、工具调用和执行结果,降低模型接入 Codex 等 Agent 工具的适配成本。
值得关注
本次更新包含两部分:重新后训练后的模型权重,以及更适合 Agent 使用的接口和运行环境。最终成绩由模型、推理预算、工具环境和 Agent 框架共同决定,不能简单归功于其中某一项。
现阶段尚不能得出“后训练可替代模型扩容”或“V4-Flash 已全面领先其他 Agent 模型”的结论。一方面,V4-Flash-0731 的具体后训练变化尚未公开;另一方面,官方测试所用 Harness 和内部数据集暂不具备完整的外部复现条件。
更准确的理解是,DeepSeek 正在验证一条务实的技术路线:在模型结构和参数规模保持不变时,能否通过重新后训练、工具接口适配和 Agent 运行框架,进一步提高模型完成真实任务的能力。具体实际效果仍有待更多训练细节、公开工具和第三方测试结果。
