DeepSeek-V4.1-Flash
概述
DeepSeek-V4.1-Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的原生多模态混合专家(MoE)模型。该模型采用 5520 亿参数主干和 Causal Encoder-Decoder 架构,支持 100 万 Token 上下文窗口;每个 Token 在预填充阶段激活 80 亿参数,在解码阶段激活 160 亿参数。在 B.AI 中使用模型名称:DeepSeek-V4.1-Flash。
B.AI 模型路由说明
B.AI 将逐步把使用 DeepSeek-V4-Flash 和 DeepSeek-V4-Flash-Vision-Exp 模型名称发起的请求路由至 DeepSeek-V4.1-Flash。路由生效后,相关请求将统一按照 DeepSeek-V4.1-Flash 的适用价格计费。
核心特性
- Causal Encoder-Decoder 架构: 采用 40 层 Transformer,由 20 层因果编码器和 20 层解码器组成。解码器的全局 KV Cache 由编码器输出生成,可降低输入密集型 Agent 工作负载的活跃计算量。
- 压缩长上下文推理: 结合 CSA2、分层稀疏索引、FP4 KV Cache 和 SWA Bounded Replay,降低长上下文推理中的常驻全局 KV Cache 开销。
- 原生多模态训练: 支持图像与文本联合输入并输出文本;视觉编码器与投影器从语言模型预训练阶段即参与训练,而非仅在后训练阶段附加。
- 可控推理: 托管 API 支持
low、high和max推理强度,默认以high开启思考。 - 结构化与工具调用: 支持 JSON 输出、工具调用、上下文缓存、Chat Prefix Completion,以及非思考模式下的 FIM。
适用场景
- 长周期编程 Agent: 适用于依赖长上下文和工具调用的代码仓库级实现、调试、测试和终端任务。
- 多模态软件工作流: 可在修改代码或其他内容时分析截图、渲染界面、图表和工具输出的图像。
- 文档与图表分析: 通过原生图文输入,提取并分析截图、扫描文档、仪表盘和图表。
- 高并发 Agent 系统: 适合关注长上下文推理、缓存效率和运行成本的输入密集型工作负载。
- 结构化自动化: 适用于分类、抽取、JSON 格式响应和多步骤工具编排。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 支持 low、high 和 max 推理强度。默认以 high 开启思考;Responses API 可通过 none 关闭思考。 |
| 编程与 Agent | 面向长周期编程、代码仓库操作、终端任务和多步骤 Agent 工作流。 |
| 多模态能力 | 支持文本和图像输入,输出为文本。 |
| 上下文窗口 | 100 万 Tokens。 |
| 最大输出 | 384K Tokens。 |
| 工具调用 | 支持函数调用、JSON 输出、上下文缓存、Responses API 中包含图像的工具输出、Chat Prefix Completion,以及非思考模式下的 FIM Completion。 |
已知限制
- 托管 API 将推理控制映射为
low、high和max;其他兼容的推理强度可能会被映射,而不会保留为独立档位。 - 在思考模式下,
temperature、presence_penalty和frequency_penalty不影响生成。工具调用的多轮对话需要在后续请求中返回此前的reasoning_content。 - 图像仅支持放在规定的用户消息或工具输出位置;在
system或assistant消息中传入图像会返回 HTTP 400 错误。 - DeepSeek 未单独公布最大输入 Token 数、知识截止日期或完整的语言支持列表。
积分消耗
| 计费时段 | 输入 (Credits/Token) | 缓存写入 (Credits/Token) | 缓存读取 (Credits/Token) | 输出 (Credits/Token) | 网页搜索(Credits/次) | 计费说明 |
|---|---|---|---|---|---|---|
| 闲时 | 0.15 | 0.15 | 0.003 | 0.60 | - | 缓存写入:输入价的 1x;缓存读取:输入价的 0.02x |
| 忙时 | 0.30 | 0.30 | 0.006 | 1.20 | - | 缓存写入:输入价的 1x;缓存读取:输入价的 0.02x |
价格说明
本表展示 DeepSeek-V4.1-Flash 的分时标准参考价。API 调用按北京时间(UTC+8)实行分时计费:忙时为周一至周五 09:00-12:00 和 14:00-18:00;其余时间(包括周六、周日全天)为闲时。B.AI Chat 中的 DeepSeek-V4.1-Flash 按闲时价格计费。文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用;B.AI 可能会通过活动、充值赠送及账户权益等方式,为用户提供更低的实际使用成本。