跳到主要内容

MiMo-V2.6-Flash

概述

MiMo-V2.6-Flash 是小米 MiMo 于 2026 年 9 月 22 日发布的开放权重原生多模态推理模型。其 API 模型 ID 为 mimo-v2.6-flash,结合稀疏 Mixture-of-Experts 架构与 1M Token 上下文窗口,面向高频调用、大规模办公负载,以及成本敏感的编程和 Agent 应用。

核心特性

  • 高效稀疏架构:总参数量为 3090 亿,激活参数量为 150 亿;公开的 MiMo-V2.6-Flash-RL 检查点采用 MIT 许可证。
  • 原生多模态理解:共同处理文本、图像、视频和音频,适合结合书面指令、视觉和声音证据的工作流。
  • 长上下文 Agent 工作:在 1M Token 窗口内处理大量源材料、代码库上下文和工具历史。
  • 广泛的 Agent 训练:混合强化学习覆盖编程、通用 Agent、视觉任务和网络安全,并使用多种 Agent 框架。
  • 灵活的 API 工作流:支持开关深度思考、函数调用、流式输出、JSON 输出、提示词缓存和折扣异步批处理。

适用场景

  • 高频办公自动化:摘要、分类和结构化提取;较低的 Token 价格与批处理有助于控制总体成本。
  • 视觉工作流 Agent:理解截图和界面状态,再通过外部工具完成并检查日常计算机任务。
  • 迭代式编程辅助:结合代码、工具结果和视觉反馈进行实现、调试及测试修改循环。
  • 多模态文档分析:在共享上下文中审阅大量文本、图表、录音和视频。

能力与限制

能力维度说明
推理能力深度思考默认开启,可在 Chat Completions 中通过 thinking.type 关闭。
编程能力小米发布的模型卡评测显示,其 DeepSWE v1.1 得分为 67.9。
Agent 评测小米报告其 Toolathlon-Verified 和 OSWorld-Verified 得分分别为 73.6 和 80.8;这些是模型提供方公布的评测结果,不代表生产环境保证。
多模态能力支持文本、图像、视频和音频输入,输出文本。
上下文窗口1M Token。
最大输出131,072 Token,由推理内容与最终回答共享。
工具调用支持函数调用及小米单独计费的网页搜索服务。
结构化输出支持 JSON object 模式;字段、类型和嵌套结构仍由提示词定义,并需在应用端校验。

已知限制

  • 原生输出为文本;计算机操作和媒体创作需要外部工具或生成代码。
  • 思考模式固定使用 temperature=1.0top_p=0.95。多轮工具对话必须保留历史 reasoning_content,缺失时可能导致 HTTP 400 错误。
  • Chat Completions 仅支持 tool_choice=auto,其他值会被忽略并按自动选择处理。

标准价格

以下 Token 价格均以美元计价,单位为每 100 万 Token;网页搜索按次计费。

模型输入
(USD / 1M Tokens)
缓存写入
(USD / 1M Tokens)
缓存读取
(USD / 1M Tokens)
输出
(USD / 1M Tokens)
网页搜索
(USD / 次)
MiMo-V2.6-Flash$0.14$0.14$0.0028$0.28-

Credits 结算: B.AI 按照 1 USD = 1,000,000 Credits 换算,并从账户余额中扣除 Credits。

价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。