2026 年 7 月 31 日,DeepSeek 正式发布 DeepSeek-V4-Flash-0731。它是此前 DeepSeek V4 Flash Preview 的正式版本,重点提升了代码 Agent、终端操作、工具调用和长时间自动化任务能力。
根据 DeepSeek 官方更新说明,0731 版本没有扩大基础模型结构,而是在保持 V4 Flash 原有架构和参数规模的情况下重新进行了后训练。换句话说,这次提升主要来自训练与对齐,而不是单纯增加参数。
截至 2026 年 8 月 2 日,CAI API 模型广场已经收录:
deepseek-v4-flash-0731
deepseek-v4-flash
开发者可以通过 OpenAI 兼容接口调用。具体可用模型仍以当前 API Key 请求 /v1/models 返回的列表为准。
DeepSeek V4 Flash 0731 是什么?
DeepSeek V4 Flash 是一个采用混合专家架构的文本大模型。根据 DeepSeek-V4 技术报告,它的基础模型拥有:
| 项目 |
参数 |
| 模型架构 |
MoE 混合专家 |
| 总参数 |
284B |
| 每个 Token 激活参数 |
13B |
| 上下文窗口 |
1M Tokens |
| 最大输出长度 |
384K Tokens |
| 输入输出模态 |
纯文本 |
| 开放协议 |
MIT |
| 预训练数据 |
超过 32T Tokens |
虽然总参数达到 284B,但模型在处理每个 Token 时只激活约 13B 参数。相比 V4 Pro Preview 的 1.6T 总参数和约 49B 激活参数,Flash 的单 Token 激活量只有后者的约 27%。
这也是 “Flash” 的核心定位:在尽量控制推理成本的同时,提供接近旗舰模型的代码与 Agent 能力。
284B 和 304B 为什么不一致?
DeepSeek 技术报告和官方更新将 V4 Flash 描述为 284B 总参数、13B 激活参数,但 Hugging Face 仓库页面目前显示的 checkpoint 模型大小为 304B。
官方模型卡同时说明,0731 checkpoint 附带了 DSpark 推测解码模块。两组数字的差异可能来自 checkpoint 对附加模块的统计,但官方暂未明确给出换算关系。
因此,本文采用技术报告中的 284B 作为基础模型规模,同时保留 Hugging Face 页面显示 304B checkpoint 的说明,避免将两组数据混为一谈。
0731 版本升级了什么?
DeepSeek 官方明确表示:
DeepSeek-V4-Flash-0731 与 V4-Flash Preview 保持相同的模型结构和尺寸,仅重新进行了后训练。
这意味着它不是一次架构换代,而是一次以 Agent 能力为重点的后训练升级。
主要变化包括:
- 代码仓库理解能力增强;
- 终端命令执行与环境操作能力增强;
- 多轮工具调用能力增强;
- 复杂任务规划与持续执行能力增强;
- 支持
low、high 和 max 三档思考强度;
- 原生支持 Responses API;
- 针对 Codex 等代码 Agent 工具进行了适配;
- 附带 DSpark 推测解码模块。
其中,官方 API 默认开启思考模式,默认思考强度为 high。复杂代码和 Agent 任务可以尝试 max,普通问答或对响应时间更敏感的场景可以使用 low 或关闭思考模式。
官方 Agent 基准成绩
下面的数据来自 DeepSeek 官方模型卡。代码 Agent 任务使用 max 思考强度,并通过尚未公开发布的 DeepSeek Harness 极简模式进行测试。
| Benchmark |
V4 Flash 0731 |
Flash Preview |
V4 Pro Preview |
GLM-5.2 |
Opus-4.8 |
| Terminal Bench 2.1 |
82.7 |
61.8 |
72.1 |
81.0 |
85.0 |
| NL2Repo |
54.2 |
39.4 |
38.5 |
48.9 |
69.7 |
| Cybergym |
76.7 |
38.7 |
52.7 |
— |
83.1 |
| DeepSWE |
54.4 |
7.3 |
12.8 |
46.2 |
58.0 |
| Toolathlon-Verified |
70.3 |
49.7 |
55.9 |
59.9 |
76.2 |
| Agents’ Last Exam |
25.2 |
15.8 |
16.5 |
23.8 |
25.7 |
| AutomationBench Public |
25.1 |
10.8 |
12.8 |
12.9 |
27.2 |
从官方结果看,进步最大的项目主要集中在代码与 Agent 场景:
- Terminal Bench 2.1 从 61.8 提升至 82.7;
- DeepSWE 从 7.3 提升至 54.4;
- Cybergym 从 38.7 提升至 76.7;
- Toolathlon-Verified 从 49.7 提升至 70.3;
- AutomationBench Public 从 10.8 提升至 25.1。
V4 Flash 0731 在这些项目中全部超过 V4 Pro Preview,并在多项任务上超过 GLM-5.2。
不过,它在表格中的多数项目仍低于 Opus-4.8。因此,更准确的结论是:V4 Flash 0731 已进入闭源旗舰模型的竞争区间,而不是全面超过闭源模型。
另外,官方完整表格中的 DSBench-FullStack 和 DSBench-Hard 属于 DeepSeek 内部测试集,外部暂时无法完整复现,因此本文没有把它们作为主要结论依据。
Artificial Analysis 独立评分
除了厂商自测,Artificial Analysis 也对 V4 Flash 0731 进行了独立评估。
在 Artificial Analysis Intelligence Index v4.1 中,它获得了 50 分,比上一版 V4 Flash 的 40 分提高了 10 分。
| 模型 |
Intelligence Index |
| Kimi K3 Max |
57 |
| GLM-5.2 Max |
51 |
| GPT-5.6 Luna Max |
51 |
| DeepSeek V4 Flash 0731 Max |
50 |
| Gemini 3.6 Flash |
50 |
| DeepSeek V4 Flash Preview |
40 |
这个结果意味着 V4 Flash 0731 已进入第三方综合评分的一线区域:
- 与 Gemini 3.6 Flash 同为 50 分;
- 距离 GLM-5.2 Max 和 GPT-5.6 Luna Max 只有 1 分;
- 比上一版 V4 Flash 高出 10 分;
- 距离开放权重前沿 Kimi K3 Max 仍有 7 分。
Agent 任务表现
Artificial Analysis 在 GDPval-AA v2 真实工作 Agent 测试中给出了以下结果:
- V4 Flash 0731:1559 Elo;
- 上一版 V4 Flash:1189 Elo;
- GLM-5.2 Max:1510 Elo;
- Kimi K3 Max:1687 Elo。
在这项测试中,V4 Flash 0731 超过了 GLM-5.2 Max,但仍低于 Kimi K3 Max。
Artificial Analysis 测得的 Terminal-Bench 2.1 成绩约为 79%,低于 DeepSeek 官方公布的 82.7%。两者绝对分数不同,但都支持同一个结论:0731 的终端和 Agent 能力相较 Preview 有明显提升。
输出 Token 使用量
Artificial Analysis 表示,V4 Flash 0731 跑完整套 Intelligence Index 大约使用了 2.06 亿输出 Token,上一版约为 2.34 亿。
输出 Token 总量下降约 12%,说明模型不仅综合得分提高,在部分任务上的推理过程也变得更加紧凑。
幻觉问题改善了吗?
Artificial Analysis 给出的 AA-Omniscience Index 为 -16,上一版本为 -23,提高了 7 分。
但这项提升主要来自模型减少了错误作答,而不是知识准确率显著上升:
- 特定测试中的准确率仍约为 37%;
- 对应的幻觉率从上一版约 96% 降至 84%。
这里的 84% 是 AA-Omniscience 特定知识边界测试中的指标,不能理解成模型在日常使用中有 84% 的概率产生幻觉。
它说明的是:面对自己不确定的问题时,0731 比上一版本更愿意表达不确定性,但并不代表事实准确性问题已经完全解决。
在搜索、研究、金融、医疗和法律等场景中,仍然应该配合检索、来源引用和结果验证。
上下文与 Agent 能力
V4 Flash 0731 支持 100 万 Token 上下文,最大输出长度为 384K Tokens。
它适合处理:
- 大型代码仓库;
- 多文件重构任务;
- 长篇技术文档;
- 多轮工具调用记录;
- 长时间运行的 Coding Agent;
- 需要保留大量历史信息的自动化工作流。
不过,“支持 100 万 Token”只代表接口允许输入如此长的上下文,并不代表模型在上下文的每个位置都能保持完全相同的检索与推理准确率。
Artificial Analysis 给出的 AA-LCR 长上下文推理成绩为 66%。因此,处理超长输入时,仍然建议:
- 使用清晰的文件和章节边界;
- 删除无关日志和重复内容;
- 将核心要求放在明确位置;
- 对关键结论进行二次验证;
- 不要把上下文容量直接等同于上下文准确率。
DeepSeek 官方 API 价格
截至 2026 年 8 月 2 日,DeepSeek 官方基础价格为:
| 计费项目 |
每百万 Tokens |
| 缓存命中输入 |
0.02 元 |
| 缓存未命中输入 |
1 元 |
| 输出 |
2 元 |
官方还预告将采用峰谷定价策略。北京时间每日 9:00—12:00 和 14:00—18:00 的高峰价格可能变为基础价格的两倍,具体实施时间以官方通知为准。
价格会发生变化,因此实际使用时应重新查看官方价格页面。
通过 CAI API 调用
截至本文发布前,CAI API 模型广场已经收录:
deepseek-v4-flash-0731
deepseek-v4-flash
其中,带日期的模型 ID 适合锁定 0731 版本;不带日期的 ID 更适合作为稳定别名使用。
CAI API 模型广场当前展示的基础计价说明为:
- 输入:0.50 积分 / 1M Tokens;
- 输出:1.00 积分 / 1M Tokens。
不同价格分组可能应用不同倍率,实际扣费请以模型广场和请求计价结果为准。
cURL 调用示例
curl "https://caicaiapi.cloud/v1/chat/completions" \
-H "Authorization: Bearer 你的API密钥" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-0731",
"messages": [
{
"role": "user",
"content": "请分析这个项目的目录结构,并给出三个优先级最高的重构建议。"
}
],
"stream": true
}'
## 适合哪些使用场景?
V4 Flash 0731 比较适合以下任务:
- Coding Agent 与终端自动化;
- 代码仓库分析、修改和重构;
- 多轮函数调用和工具调用;
- 长文档总结与信息提取;
- 复杂任务规划;
- 成本敏感的大规模文本处理;
- 需要开放权重进行私有化部署的项目。
对于普通聊天、简单分类和短文本生成,始终使用 max 思考强度未必划算。低难度任务可以采用非思考模式或较低的思考强度。
## 当前还存在哪些限制?
### 1. 不是多模态模型
V4 Flash 0731 当前是文本输入、文本输出模型,不应将它描述为图片、音频或视频理解模型。
### 2. 并非所有能力都超过闭源旗舰
它在多项 Agent 基准中已经接近 Opus-4.8,但官方表格里的多数成绩仍然低于 Opus-4.8。
### 3. 独立速度数据仍然不足
截至 2026 年 8 月 2 日,Artificial Analysis 尚未给出稳定的输出速度、首 Token 延迟和端到端响应时间数据。
因此,“Flash”可以理解为架构效率和产品定位,但暂时不应写成“已经被第三方证明是速度最快的模型”。
### 4. 部分官方评测条件尚未完全开放
官方代码 Agent 测试使用了尚未发布的 DeepSeek Harness 极简模式,部分 DSBench 项目也是内部测试集。实际业务效果仍需要结合自己的工具、提示词和任务流程进行验证。
## 常见问题
### DeepSeek V4 Flash 0731 是 V4 Pro 的压缩版吗?
不是。Flash 和 Pro 是 V4 系列中的两种不同规模。Flash 主干约为 284B 总参数、13B 激活参数,Pro Preview 约为 1.6T 总参数、49B 激活参数。
### 0731 比 Preview 增加参数了吗?
根据 DeepSeek 官方更新,没有。两者保持相同模型结构和尺寸,0731 的主要改进来自重新后训练。
### 应该使用哪个模型 ID?
希望锁定本次版本时,可以使用:
```text
deepseek-v4-flash-0731
希望使用稳定别名时,可以使用:
deepseek-v4-flash
它是目前能力最强的开放权重模型吗?
不能简单这样判断。Artificial Analysis 给它的综合评分是 50,低于 Kimi K3 Max 的 57,也略低于 GLM-5.2 Max 的 51。但它在成本、激活参数、百万上下文和 Agent 能力之间形成了很有竞争力的组合。
总结
DeepSeek V4 Flash 0731 最值得关注的地方,不是基础参数规模发生了变化,而是它在保持 284B 总参数、13B 激活参数和百万 Token 上下文的情况下,通过后训练显著提高了 Agent 与代码工程能力。
官方基准显示,它在 Terminal Bench、DeepSWE、Cybergym 和 Toolathlon 等任务上大幅超过 Preview,并超过 V4 Pro Preview。Artificial Analysis 的独立综合评分也从上一版的 40 提升至 50,证明这次升级并不只是官方单方面宣传。
它仍然存在知识幻觉、独立速度数据不足和部分测试无法完整复现等问题,但对于代码 Agent、长上下文处理、工具调用和成本敏感型自动化任务,V4 Flash 0731 已经成为一个值得测试的选择。
CAI API 已收录版本化模型 ID 和稳定模型 ID,开发者可以使用现有 OpenAI SDK 直接接入,无需维护另一套调用协议。
参考资料