MiMo-V2.6-Flash
概述
MiMo-V2.6-Flash 是小米 MiMo 于 2026 年 9 月 22 日发布的开放权重原生多模态推理模型。其 API 模型 ID 为 mimo-v2.6-flash,结合稀疏 Mixture-of-Experts 架构与 1M Token 上下文窗口,面向高频调用、大规模办公负载,以及成本敏感的编程和 Agent 应用。
核心特性
- 高效稀疏架构:总参数量为 3090 亿,激活参数量为 150 亿;公开的 MiMo-V2.6-Flash-RL 检查点采用 MIT 许可证。
- 原生多模态理解:共同处理文本、图像、视频和音频,适合结合书面指令、视觉和声音证据的工作流。
- 长上下文 Agent 工作:在 1M Token 窗口内处理大量源材料、代码库上下文和工具历史。
- 广泛的 Agent 训练:混合强化学习覆盖编程、通用 Agent、视觉任务和网络安全,并使用多种 Agent 框架。
- 灵活的 API 工作流:支持开关深度思考、函数调用、流式输出、JSON 输出、提示词缓存和折扣异步批处理。
适用场景
- 高频办公自动化:摘要、分类和结构化提取;较低的 Token 价格与批处理有助于控制总体成本。
- 视觉工作流 Agent:理解截图和界面状态,再通过外部工具完成并检查日常计算机任务。
- 迭代式编程辅助:结合代码、工具结果和视觉反馈进行实现、调试及测试修改循环。
- 多模态文档分析:在共享上下文中审阅大量文本、图表、录音和视频。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 深度思考默认开启,可在 Chat Completions 中通过 thinking.type 关闭。 |
| 编程能力 | 小米发布的模型卡评测显示,其 DeepSWE v1.1 得分为 67.9。 |
| Agent 评测 | 小米报告其 Toolathlon-Verified 和 OSWorld-Verified 得分分别为 73.6 和 80.8;这些是模型提供方公布的评测结果,不代表生产环境保证。 |
| 多模态能力 | 支持文本、图像、视频和音频输入,输出文本。 |
| 上下文窗口 | 1M Token。 |
| 最大输出 | 131,072 Token,由推理内容与最终回答共享。 |
| 工具调用 | 支持函数调用及小米单独计费的网页搜索服务。 |
| 结构化输出 | 支持 JSON object 模式;字段、类型和嵌套结构仍由提示词定义,并需在应用端校验。 |
已知限制
- 原生输出为文本;计算机操作和媒体创作需要外部工具或生成代码。
- 思考模式固定使用
temperature=1.0和top_p=0.95。多轮工具对话必须保留历史reasoning_content,缺失时可能导致 HTTP 400 错误。 - Chat Completions 仅支持
tool_choice=auto,其他值会被忽略并按自动选择处理。
标准价格
以下 Token 价格均以美元计价,单位为每 100 万 Token;网页搜索按次计费。
| 模型 | 输入 (USD / 1M Tokens) | 缓存写入 (USD / 1M Tokens) | 缓存读取 (USD / 1M Tokens) | 输出 (USD / 1M Tokens) | 网页搜索 (USD / 次) |
|---|---|---|---|---|---|
| MiMo-V2.6-Flash | $0.14 | $0.14 | $0.0028 | $0.28 | - |
Credits 结算: B.AI 按照 1 USD = 1,000,000 Credits 换算,并从账户余额中扣除 Credits。
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。