核心内容:
- V4 Flash正式版API上线,重点增强Agent和Coding Agent能力。
- 基准测试显示在多项Agent及编程基准中超过预览版和GLM-5.2。
- 原生支持Responses API,并针对Codex优化,V4-Pro正式版预计8月初发布。
7月31日,DeepSeek上线V4-Flash正式版API。此次更新没有调整模型结构和尺寸,只是在预览版基础上重新进行后训练,重点增强 Agent 与 Coding Agent 能力。
目前仅 API 接口完成升级,DeepSeek-V4-Pro 以及 App、网页端模型均未变化,据DeepSeek 官网透露,V4-Pro 正式版将于8月初发布。
DeepSeek公布的测试结果显示,V4-Flash 正式版在 9项 Agent 及编程基准中均明显超过 Flash 预览版,并全部高于V4-Pro-Preview。
Terminal Bench 2.1得分由61.8升至82.7,超过 V4-Pro 预览版的 72.1 和 GLM-5.2 的81.0,仅低于 Opus 4.8 的 85.0;CyberGym 由38.7升至76.7,DeepSWE 则从7.3跃升至54.4。
Terminal-Bench 2.1主要测试 AI Agent 在真实命令行环境中,能否独立完成复杂的端到端任务。
在工具使用任务中,新模型的 Toolathlon-Verified 得分为70.3,Agents’ Last Exam为25.2,分别接近Opus 4.8的76.2和25.7。
AutomationBench也从10.8提高至25.1,接近Opus 4.8的27.2。
不过,上述成绩来自DeepSeek在指定Harness及参数下完成的官方测试,实际表现仍有待第三方评测和生产任务验证。
接口适配也是此次更新的重点。
V4-Flash正式版原生支持 Responses API,并针对Codex进行优化,可作为 Codex 的后端模型使用。
DeepSeek官方文档显示,目前 Responses API 仅支持 V4-Flash,V4-Pro 预计于8月初接入。 此前发布的 V4预览版已支持 100万Token 上下文,Flash 被定位为速度和成本优先的版本。
参考链接:
https://api-docs.deepseek.com/zh-cn/guides/responses_api/?wxwork_userid=lyxia