MiMo-V2.5
概述
MiMo-V2.5 是小米 MiMo 于 2026 年 4 月 23 日进入公开测试的开放权重原生全模态模型。它将一个 3100 亿参数的稀疏 Mixture-of-Experts(MoE)语言骨干网络与专用视觉、音频编码器结合,可在长上下文 Agent 工作流中理解文本、图像、视频和音频。
核心特性
- 原生全模态理解: 在同一模型中处理文本、图像、视频和音频输入;除语言骨干网络外,还包含 7.29 亿参数视觉编码器和 2.61 亿参数音频编码器。
- 310B 稀疏 MoE 架构: 总参数量为 3100 亿,激活参数量为 150 亿,包含 256 个路由专家,每个 token 选择其中 8 个专家。
- 高效 1M Token 上下文: 以 5:1 的模式交错使用 39 层滑动窗口注意力和 9 层全局注意力。小米表示,在保留长上下文能力的同时,KV Cache 存储可降低近 6 倍。
- 多模态与编程评测: 小米报告其在 MMMU-Pro、Video-MME、Claw-Eval Multimodal、Terminal-Bench 2.0 和 SWE-Bench Pro 上的得分分别为 77.9、87.7、23.8、65.8 和 56.1。
- 面向 Agent 的 API 控制: 支持深度思考、流式输出、函数调用、结构化输出,以及小米单独计费的网页搜索服务。
适用场景
- 多模态分析: 结合书面指令和上下文数据,理解截图、图表、扫描文档、视频和音频。
- 视觉与媒体 Agent: 检查多模态信息、对其推理、调用工具,并生成文本回复或行动计划。
- 通用编程与自动化: 利用图像化 UI 上下文、终端工具和结构化输出完成软件任务,相比 Pro 版本具有更低的 API 成本。
- 长上下文应用: 支持文档分析、代码库辅助、媒体档案和最长 100 万 token 的长对话。
能力与限制
| 能力维度 | 说明 |
|---|---|
| 推理能力 | 深度思考默认开启,可通过 thinking.type 关闭。小米官方多模态结果包括 MMMU-Pro 77.9 和 CharXiv RQ 81.0。 |
| 编程能力 | 小米报告其在 MiMo Coding Bench、Claw-Eval Text、Terminal-Bench 2.0 和 SWE-Bench Pro 上的得分分别为 71.8、62.3、65.8 和 56.1。 |
| 创意写作 | 支持通用和长篇文本生成。 |
| 多模态能力 | 支持文本、图像、视频和音频输入,输出为文本。官方结果包括 Video-MME 87.7、DailyOmni 83.5 和 Claw-Eval Multimodal 23.8。 |
| 上下文窗口 | 1M token。 |
| 最大输出 | 128K token。 |
| 工具调用 | 支持函数调用、结构化输出、流式输出和小米网页搜索工具。思考模式的 Agent 对话中,工具调用历史需保留完整的 reasoning_content 字段。 |
| 多语言能力 | 官方模型仓库标注支持英文和中文。 |
已知限制
- 托管 API 提供多模态理解和文本输出,不原生生成图像、音频或视频。
- 在思考模式下,自定义
temperature和top_p不生效,API 固定使用1.0和0.95。多轮工具工作流若遗漏历史reasoning_content,可能返回 HTTP 400 或导致上下文质量下降。
价格
| 模型名称 | 输入(Credits/Token) | 缓存写入(Credits/Token) | 缓存读取(Credits/Token) | 输出(Credits/Token) | 网页搜索(Credits/次) |
|---|---|---|---|---|---|
| MiMo-V2.5 | 0.14 | 0.14 | 0.0028 | 0.28 | - |
价格说明
文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。