2026 年 9 月 22 日,小米正式发布并开放MiMo-V2.6 系列。
这一代 MiMo 的几个关键词非常明确:
万亿参数 MoE、1M 超长上下文、原生全模态、Coding、Agent、大规模强化学习,以及低价 API。
其中 MiMo-V2.6-Pro 总参数达到1.02T,并在 Artificial Analysis Intelligence Index 中取得46 分左右;而 MiMo-V2.6-Flash 的国内 API 普通输入价格只有1 元/百万 Token。
那么 MiMo-V2.6 到底用了什么架构?Coding 能力怎么样?API 有多便宜?值不值得用?
本文一次讲清楚。
一、MiMo-V2.6 有哪些版本?
目前主要有三个:
其中真正的两个核心模型是Flash 和 Pro。
UltraSpeed 可以理解成 Pro 的高速服务版本。官方称在保持 Pro 能力的情况下,最高可以达到普通 Pro20 倍输出速度,但 API 价格也明显更高。
Pro 和 Flash 都支持:
文本、图片、视频、音频输入 → 文本输出
并支持深度思考、工具调用、联网搜索、结构化输出、上下文缓存等功能。
两者 API 最大上下文都是1M Token,最大输出128K Token。
二、架构:万亿参数,不代表每次都跑万亿参数
MiMo-V2.6 的核心架构是:
Sparse MoE(稀疏混合专家模型)
简单理解:
输入 Token ↓ Router 路由器 ↓ 从大量 Expert 中选择少数专家 ↓ 参与本次计算 ↓ 生成结果以 Pro 为例:
总参数:1.02T
每个 Token 激活参数:42B
70 层 Transformer
384 个 Routed Experts
每次激活 8 个 Expert
Flash 则是:
总参数:309B
激活参数:15B
48 层 Transformer
256 个 Routed Experts
每次激活 8 个 Expert
所以 Pro 虽然超过1 万亿参数,但推理时不会让全部参数同时参与计算。
SWA + Global Attention
MiMo-V2.6 还采用了混合注意力:
Sliding Window Attention(SWA)+ Global Attention(GA)
SWA 负责处理局部信息,Global Attention 定期进行全局信息交互。
这样做的一个重要目的就是降低超长上下文的计算和 KV Cache 压力。
此外,模型还包含5 层 MTP speculative decoder,用于加速生成。
所以 MiMo-V2.6 的整体思路可以简单概括成:
Sparse MoE + SWA / Global Attention + MTP + 1M Context三、不只是文本模型,而是原生全模态
MiMo-V2.6 原生支持:
视觉部分采用681M 参数 MiMo ViT,音频部分包含308M AudioTokenizer + 127M Audio Patch Encoder。
所以这一代 MiMo 的目标明显已经不只是“聊天机器人”。
小米展示的实际应用已经包括:
前端开发
PPT 制作
3D 建模
游戏开发
Computer Use
多 Agent 协作
科研任务
甚至提出了Vibe World:通过自然语言、图片或视频,让多个 Agent 协作完成 3D 场景、交互逻辑和视觉验证。
四、真正值得关注的是 Agent 强化学习
MiMo-V2.6 一个很重要的变化,就是强化了Agentic RL。
小米没有把 Coding、Agent、视觉、网络安全完全拆开训练,而是把:
Coding General Agent Visual Agent Cybersecurity混合进同一套强化学习训练中。
官方披露,Flash 和 Pro 都在不到 6 天内完成约30 个 RL Step、约 75 万条 Trajectory,训练成本分别约85 万美元和 262 万美元。
在训练过程中,DeepSWE v1.1 成绩也出现明显提升:
Flash:48.8 → 65.68
Pro:58.4 → 72.57
需要注意:这是RL 训练过程曲线,与最终模型卡公布的正式 Benchmark 数字不是同一组测试结果。
五、Coding 能力到底怎么样?
这可能是开发者最关心的一部分。
小米官方模型卡公布的数据如下:
| 以上数据来自小米官方模型卡。 |
从这些数据能看出一个比较明显的特点:
MiMo-V2.6 的强项并不是简单写一道代码题,而是 Agentic Coding。
也就是:
读取代码仓库 ↓ 分析问题 ↓ 调用 Terminal / 工具 ↓ 修改多个文件 ↓ 执行测试 ↓ 检查结果 ↓ 继续修改例如 DeepSWE v1.1 中,MiMo-V2.6-Pro 达到71.9,与官方模型卡列出的 Claude Opus 5 的 74.0、GPT-5.6 Sol 的 73.0 已经比较接近。
但它也不是所有榜单都领先。
例如 Terminal Bench 4.0:
MiMo-V2.6-Pro 34.9 GPT-5.6 Sol 39.9 Claude Opus 5 49.0所以更准确的说法应该是:
MiMo-V2.6 的 Coding 和 Agent 能力已经进入当前主流旗舰模型竞争区间,但不同任务之间依然存在明显差异。
而不是简单说“全面超过 Claude / GPT”。
六、第三方榜单表现怎么样?
除了小米自己的模型卡,还可以看独立评测机构Artificial Analysis。
截至本文撰写时:
| 指标 | Flash | Pro |
|---|---|---|
| Intelligence Index | 38 | 46 |
| 输出速度 | 约51 token/s | 约42 token/s |
| 每任务成本 | $0.06 | $0.13 |
| 上下文 | 1M | 1M |
Artificial Analysis 当前将 MiMo-V2.6-Pro 列在其开放权重模型 Intelligence Index 的#1 / 117。
小米发布时给出的更精确分数为46.32,对应 Artificial Analysis Intelligence Index v4.3。
这里一定要注意:
“Artificial Analysis 榜单第一” ≠ “所有任务都是世界第一”。
它只能说明 MiMo-V2.6-Pro 在这个综合指数及对应比较范围中表现非常突出。
七、API 价格可能才是最大的亮点
国内实时 API 价格如下:
| 模型 | 缓存命中输入 | 普通输入 | 输出 |
|---|---|---|---|
| Flash | ¥0.02/M | ¥1/M | ¥2/M |
| Pro | ¥0.025/M | ¥3/M | ¥6/M |
| Pro-UltraSpeed | ¥0.25/M | ¥30/M | ¥60/M |
单位均为:
元 / 100 万 Token。
其中 Flash 特别夸张:
普通输入 100 万 Token 只要 1 元。
如果长期运行 Coding Agent,往往会重复传入:
项目代码
System Prompt
历史对话
Agent Memory
工具调用结果
这时候缓存价格也非常关键。
Flash 的缓存命中输入只有:
0.02 元 / 100 万 Token。
另外,小米还提供Batch API,目前 Pro 和 Flash 的批量推理价格只有实时 API 的50%。
对于批量数据处理、模型评测、摘要和离线任务来说会更加便宜。
八、API 接入也比较简单
MiMo API 同时兼容:
OpenAI API
Anthropic Messages API
如果项目原本使用 OpenAI SDK,通常只需要修改:
API Key base_url modelOpenAI 兼容接口的 Base URL 为:
https://api.xiaomimimo.com/v1模型名称主要使用:
mimo-v2.6-flash mimo-v2.6-pro因此对于已有 AI 应用或者 Coding Agent 来说,迁移成本比较低。
九、MiMo-V2.6 到底好不好用?
综合目前公开数据,可以把它的优缺点概括得很清楚。
优点
1. Coding / Agent 能力强
DeepSWE、AutomationBench、Terminal Bench 等测试已经达到较高水平。
2. API 非常便宜
尤其是 Flash:
输入 ¥1/M,输出 ¥2/M。
对于需要大量 Token 的 Agent 应用很有吸引力。
3. 1M 超长上下文
适合代码仓库、长文档、Agent 历史记录和大型工作流。
4. 原生全模态
文本、图片、视频、音频可以进入同一个模型。
需要注意的地方
第一,Pro 本地部署门槛非常高。
1.02T 是完整模型参数规模,即使推理时只激活 42B,也不意味着只需要存储 42B 权重。
对于绝大多数普通用户来说,直接调用 API 更现实。
第二,普通 Pro API 的速度不是最大优势。
Artificial Analysis 当前测试约为42 token/s,并不属于最快的一档。
如果特别在意实时响应,可以考虑 UltraSpeed,但价格约为普通 Pro 的 10 倍。
第三,不要只看 Benchmark。
Benchmark 成绩并不完全等于真实开发体验。
最终还是应该比较:
任务成功率 + Token 消耗 + 运行时间 + API 成本十、Flash 和 Pro 怎么选?
其实非常简单。
MiMo-V2.6-Flash
更适合:
日常 Coding
批量 API 调用
AI Agent
数据处理
自动化工作流
成本敏感场景
它只有 15B 激活参数,却在很多 Agent Benchmark 中与 Pro 差距并不算特别大,而 API 价格只有 Pro 的约三分之一。
MiMo-V2.6-Pro
更适合:
大型代码工程
长程 Agent
复杂推理
科研任务
多 Agent 协作
对成功率要求更高的任务
Pro-UltraSpeed
适合:
对延迟非常敏感,而且愿意用更高成本换速度的生产场景。
十一、最后总结
如果用几个关键词概括 MiMo-V2.6:
MiMo-V2.6-Pro 已经在 Artificial Analysis Intelligence Index 中进入当前开放权重模型的最前列;Coding 和 Agent 相关 Benchmark 也已经能够与主流旗舰模型放在同一张表里比较。
但对普通开发者来说,我认为更值得关注的其实是MiMo-V2.6-Flash:
309B 总参数、15B 激活参数、1M 上下文、DeepSWE 67.9,普通 API 输入仅 1 元/百万 Token。
小米同时已经公开 MiMo-V2.6-Pro-RL 和 Flash-RL 权重,并采用MIT License。
所以 MiMo-V2.6 真正值得关注的地方,并不是某一项 Benchmark 有没有拿第一,而是:
它正在把模型能力、Coding、Agent、长上下文和 API 成本,同时做到一个相当有竞争力的位置。
对于 Coding Agent、大规模自动化工作流和高 Token 消耗的 AI 应用,MiMo-V2.6 已经值得实际跑一次自己的项目测试。