跳到主要内容

MiMo-V2.5

概述

MiMo-V2.5 是小米 MiMo 于 2026 年 4 月 23 日进入公开测试的开放权重原生全模态模型。它将一个 3100 亿参数的稀疏 Mixture-of-Experts(MoE)语言骨干网络与专用视觉、音频编码器结合,可在长上下文 Agent 工作流中理解文本、图像、视频和音频。

核心特性

  • 原生全模态理解: 在同一模型中处理文本、图像、视频和音频输入;除语言骨干网络外,还包含 7.29 亿参数视觉编码器和 2.61 亿参数音频编码器。
  • 310B 稀疏 MoE 架构: 总参数量为 3100 亿,激活参数量为 150 亿,包含 256 个路由专家,每个 token 选择其中 8 个专家。
  • 高效 1M Token 上下文: 以 5:1 的模式交错使用 39 层滑动窗口注意力和 9 层全局注意力。小米表示,在保留长上下文能力的同时,KV Cache 存储可降低近 6 倍。
  • 多模态与编程评测: 小米报告其在 MMMU-Pro、Video-MME、Claw-Eval Multimodal、Terminal-Bench 2.0 和 SWE-Bench Pro 上的得分分别为 77.9、87.7、23.8、65.8 和 56.1。
  • 面向 Agent 的 API 控制: 支持深度思考、流式输出、函数调用、结构化输出,以及小米单独计费的网页搜索服务。

适用场景

  • 多模态分析: 结合书面指令和上下文数据,理解截图、图表、扫描文档、视频和音频。
  • 视觉与媒体 Agent: 检查多模态信息、对其推理、调用工具,并生成文本回复或行动计划。
  • 通用编程与自动化: 利用图像化 UI 上下文、终端工具和结构化输出完成软件任务,相比 Pro 版本具有更低的 API 成本。
  • 长上下文应用: 支持文档分析、代码库辅助、媒体档案和最长 100 万 token 的长对话。

能力与限制

能力维度说明
推理能力深度思考默认开启,可通过 thinking.type 关闭。小米官方多模态结果包括 MMMU-Pro 77.9 和 CharXiv RQ 81.0。
编程能力小米报告其在 MiMo Coding Bench、Claw-Eval Text、Terminal-Bench 2.0 和 SWE-Bench Pro 上的得分分别为 71.8、62.3、65.8 和 56.1。
创意写作支持通用和长篇文本生成。
多模态能力支持文本、图像、视频和音频输入,输出为文本。官方结果包括 Video-MME 87.7、DailyOmni 83.5 和 Claw-Eval Multimodal 23.8。
上下文窗口1M token。
最大输出128K token。
工具调用支持函数调用、结构化输出、流式输出和小米网页搜索工具。思考模式的 Agent 对话中,工具调用历史需保留完整的 reasoning_content 字段。
多语言能力官方模型仓库标注支持英文和中文。

已知限制

  • 托管 API 提供多模态理解和文本输出,不原生生成图像、音频或视频。
  • 在思考模式下,自定义 temperaturetop_p 不生效,API 固定使用 1.00.95。多轮工具工作流若遗漏历史 reasoning_content,可能返回 HTTP 400 或导致上下文质量下降。

价格

模型名称输入(Credits/Token)缓存写入(Credits/Token)缓存读取(Credits/Token)输出(Credits/Token)网页搜索(Credits/次)
MiMo-V2.50.140.140.00280.28-
价格说明

文档价格为 B.AI 平台模型标准参考价,仅供基础计费说明使用。B.AI 可能会通过充值赠送及账户权益等方式,为用户提供更低的实际使用成本。具体价格、赠送积分及账户权益请以平台页面展示及最终账单为准。