DeepSeek-V4-Flash
概述
DeepSeek-V4-Flash 是 DeepSeek 于 2026 年 4 月 24 日与 V4-Pro 同步发布的高效率开源大语言模型,采用 MIT License。该模型总参数量为 284B,但每次前向仅激活 13B 参数,以仅为 V4-Pro 约 1/3.1 的成本提供接近旗舰模型的性能,是当前极具性价比的模型之一。
DeepSeek-V4-Flash
活动开始时间:2026 年 8 月 17 日,适用于 B.AI Chat 和 API 中的 DeepSeek-V4-Flash。
- Chat: 活动期间使用按
0 Credits结算。 - API: 活动期间使用按
0 Credits结算,不收取单次请求、输入、缓存写入、缓存读取或输出的费用。
活动结束后,模型将恢复标准价格。活动结束时间、适用规则、实际结算结果及最终账单以平台页面展示为准。
核心特性
- 超高效率架构:总参数量 284B,每次前向仅激活 13B 参数,模型下载体积约 160GB,相比前沿模型对硬件要求更低,同时保持出色性能。
- 100 万 Token 上下文窗口:与 V4-Pro 一样支持 100 万上下文和 384K 最大输出,基于相同的 CSA/HCA 混合注意力机制,具备高效的长上下文推理能力。
- 接近 Pro 的性能与更低成本:在 SWE-bench Verified 上达到 79.0%,仅比 V4-Pro 的 80.6% 低 1.6 个百分点,标准参考输入/输出价格为 0.44 / 1.32 Credits。
- Flash-Max 推理模式:在提供更大的思考预算(384K+ 上下文)时,V4-Flash-Max 可在复杂任务上逼近 V4-Pro 的推理能力。
适用场景
- 高并发 API 场景:标准参考输入价格为每 token 0.44 Credits,适合文本量大、对单次调用成本敏感的应用。
- 自托管部署:160GB 模型体积和 13B 激活参数使其更适合本地部署或单节点 GPU 场景,不像更大的前沿模型那样依赖重型基础设施。
- Agent 工具调用链路:强工具调用和编程能力,加上更低延迟,使其非常适合多步 Agent 工作流。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 具备接近 Claude Sonnet 4.6 水平的智能表现(Artificial Analysis Index 得分 47) |
| 编程能力 | SWE-bench Verified 79.0%;编程类基准平均 64.4 |
| 多模态能力 | 当前仅支持文本,不支持图像、音频或视频 |
| 响应速度 | 13B 激活参数配合高效注意力机制,适合高吞吐场景 |
| 上下文窗口 | 1,000,000 tokens |
| 最大输出 | 384,000 tokens |
| 工具调用 | 支持函数调用,具备较强 Agent 任务执行能力 |
| 多语言能力 | 广泛支持多语言,其中英文表现最强 |
已知限制
- 当前仅支持文本,不具备多模态能力。
- 由于参数规模更小,在纯知识型任务和最复杂的 Agent 工作流上仍弱于 V4-Pro 与顶级闭源模型。
- 若要接近 Pro 级推理效果,可能需要启用 Flash-Max 模式并提供更大思考预算,这会带来更高延迟和成本。
积分消耗
| 计费时段 | 输入 (Credits/Token) | 缓存写入 (Credits/Token) | 缓存读取 (Credits/Token) | 输出 (Credits/Token) | 网页搜索(Credits/次) | 计费说明 |
|---|---|---|---|---|---|---|
| 闲时 | 0.22 | 0.22 | 0.0073 | 0.66 | - | 缓存写入:输入价的 1x;缓存读取:输入价的 0.0333x |
| 忙时 | 0.44 | 0.44 | 0.0147 | 1.32 | - | 缓存写入:输入价的 1x;缓存读取:输入价的 0.0333x |
价格说明
本表展示 DeepSeek-V4-Flash 的分时标准参考价。当前限时活动期间,B.AI Chat 和 API 的所有使用均按 0 Credits 结算。活动结束后,具体适用闲时或忙时时段、实际结算价格及最终账单以平台页面展示为准。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。