跳到主要内容

Kimi K3

概述

Kimi K3 是 Moonshot AI 的旗舰模型,于 2026 年 7 月 16 日发布。它在 API 中的模型 ID 为 kimi-k3,结合了稀疏 Mixture-of-Experts 架构、原生图像与视频理解、始终开启的推理能力,以及 1,048,576 token 上下文窗口,适合长周期代码任务、知识工作和 Agent 工作流。

核心特性

  • 稀疏 MoE 架构:使用 Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)和 Stable LatentMoE,并在每次请求中激活部分专家,以提升大规模推理效率。
  • 长周期 Agent 工作:适合浏览大型代码库、协调终端工具、执行多步骤研究,并在有限监督下产出完整的软件或知识工作成果。
  • 原生视觉理解:支持文本、图像和视频输入,可在前端工程、游戏开发、CAD、文档分析、动画和视频编辑工作流中利用视觉反馈。
  • 1M 上下文与大输出:提供 1,048,576 token 上下文窗口,并支持自动上下文缓存。max_completion_tokens 默认值为 131,072,可在总上下文限制内配置到 1,048,576。
  • 生产级 API 控制:通过 OpenAI 兼容的 Chat Completions API 支持流式输出、函数调用、tool_choice、动态工具加载、严格 JSON Schema 输出、Partial Mode 和官方 Formula tools。

适用场景

  • 大型代码库软件工程:长周期实现、调试、代码库导航、终端编排、GPU kernel 优化、编译器工作,以及带视觉反馈的前端或游戏开发。
  • 端到端知识工作:研究、金融和科学分析、文档综合、表格任务、演示文稿创建,以及结合证据、代码和可视化的交互式报告。
  • 多模态 Agent 工作流:需要在同一个 Agent 循环中处理文本、截图、图像、视频、工具和迭代视觉反馈的任务。
  • 长上下文应用:代码库助手、固定语料分析、文档问答,以及能从稳定重复前缀和自动缓存命中中受益的 Agent。

能力与限制

能力维度说明
推理能力始终使用 thinking mode;reasoning_effort 当前仅支持 max
编程能力适合长周期代码任务、代码库导航、终端工作流、编译器工作、GPU kernel 优化、调试,以及带视觉反馈的前端或游戏开发。
创作能力支持通用文本生成和长文本生成。
多模态能力支持文本、图像和视频输入,输出为文本。
响应速度延迟会受到推理长度、输出长度、媒体输入和工具使用的影响。
上下文窗口1,048,576 tokens,并支持对重复初始上下文进行自动缓存。
最大输出默认 131,072 tokens;在总上下文窗口限制内,最高可配置到 1,048,576 tokens。
工具调用支持函数调用、tool_choice、动态工具加载、结构化输出、JSON Mode、Partial Mode 和官方 Formula tools。
多语言能力支持中文和英文使用;具体语言覆盖范围可能随 Kimi API 演进。

已知限制

  • Kimi K3 当前仅支持 reasoning_effort="max"temperaturetop_pn、presence penalty 和 frequency penalty 由 API 固定。
  • 多轮对话和工具调用请求需要返回完整的 assistant message,包括 thinking history。省略该历史,或在会话中途切换到 Kimi K3,可能导致输出质量不稳定。
  • 对边界要求严格的应用,应在 system prompt 或 AGENTS.md 中提供明确约束。
  • 不直接接受公开图片 URL。图片需要使用 base64 或 ms:// 文件引用,视频需要先上传后使用。
  • 当前 B.AI 价格总表未列出该模型的内置网页搜索费用。最新运行时可用状态请以平台模型目录为准。

积分消耗

模型名称输入 (Credits/Token)Cache Write (Credits/Token)Cache Read (Credits/Token)输出 (Credits/Token)网页搜索(Credits/次)计费说明
Kimi K33.003.000.3015.00-缓存写入与输入同价;缓存读取按输入价格 0.1x 计费
价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。