拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

小米 MiMo-V2.6 全面解析:1.02T MoE、1M 上下文,Coding 有多强?API 输入 1 元/百万 Token 起

小米 MiMo-V2.6 全面解析:1.02T MoE、1M 上下文,Coding 有多强?API 输入 1 元/百万 Token 起

2026 年 9 月 22 日,小米正式发布并开放MiMo-V2.6 系列。

这一代 MiMo 的几个关键词非常明确:

万亿参数 MoE、1M 超长上下文、原生全模态、Coding、Agent、大规模强化学习,以及低价 API。

其中 MiMo-V2.6-Pro 总参数达到1.02T,并在 Artificial Analysis Intelligence Index 中取得46 分左右;而 MiMo-V2.6-Flash 的国内 API 普通输入价格只有1 元/百万 Token。

那么 MiMo-V2.6 到底用了什么架构?Coding 能力怎么样?API 有多便宜?值不值得用?

本文一次讲清楚。


一、MiMo-V2.6 有哪些版本?

目前主要有三个:

其中真正的两个核心模型是Flash 和 Pro。

UltraSpeed 可以理解成 Pro 的高速服务版本。官方称在保持 Pro 能力的情况下,最高可以达到普通 Pro20 倍输出速度,但 API 价格也明显更高。

Pro 和 Flash 都支持:

文本、图片、视频、音频输入 → 文本输出

并支持深度思考、工具调用、联网搜索、结构化输出、上下文缓存等功能。

两者 API 最大上下文都是1M Token,最大输出128K Token。


二、架构:万亿参数,不代表每次都跑万亿参数

MiMo-V2.6 的核心架构是:

Sparse MoE(稀疏混合专家模型)

简单理解:

输入 Token ↓ Router 路由器 ↓ 从大量 Expert 中选择少数专家 ↓ 参与本次计算 ↓ 生成结果

以 Pro 为例:

  • 总参数:1.02T

  • 每个 Token 激活参数:42B

  • 70 层 Transformer

  • 384 个 Routed Experts

  • 每次激活 8 个 Expert

Flash 则是:

  • 总参数:309B

  • 激活参数:15B

  • 48 层 Transformer

  • 256 个 Routed Experts

  • 每次激活 8 个 Expert

所以 Pro 虽然超过1 万亿参数,但推理时不会让全部参数同时参与计算。


SWA + Global Attention

MiMo-V2.6 还采用了混合注意力:

Sliding Window Attention(SWA)+ Global Attention(GA)

SWA 负责处理局部信息,Global Attention 定期进行全局信息交互。

这样做的一个重要目的就是降低超长上下文的计算和 KV Cache 压力。

此外,模型还包含5 层 MTP speculative decoder,用于加速生成。

所以 MiMo-V2.6 的整体思路可以简单概括成:

Sparse MoE + SWA / Global Attention + MTP + 1M Context

三、不只是文本模型,而是原生全模态

MiMo-V2.6 原生支持:

视觉部分采用681M 参数 MiMo ViT,音频部分包含308M AudioTokenizer + 127M Audio Patch Encoder。

所以这一代 MiMo 的目标明显已经不只是“聊天机器人”。

小米展示的实际应用已经包括:

  • 前端开发

  • PPT 制作

  • 3D 建模

  • 游戏开发

  • Computer Use

  • 多 Agent 协作

  • 科研任务

甚至提出了Vibe World:通过自然语言、图片或视频,让多个 Agent 协作完成 3D 场景、交互逻辑和视觉验证。


四、真正值得关注的是 Agent 强化学习

MiMo-V2.6 一个很重要的变化,就是强化了Agentic RL。

小米没有把 Coding、Agent、视觉、网络安全完全拆开训练,而是把:

Coding General Agent Visual Agent Cybersecurity

混合进同一套强化学习训练中。

官方披露,Flash 和 Pro 都在不到 6 天内完成约30 个 RL Step、约 75 万条 Trajectory,训练成本分别约85 万美元和 262 万美元。

在训练过程中,DeepSWE v1.1 成绩也出现明显提升:

  • Flash:48.8 → 65.68

  • Pro:58.4 → 72.57

需要注意:这是RL 训练过程曲线,与最终模型卡公布的正式 Benchmark 数字不是同一组测试结果。


五、Coding 能力到底怎么样?

这可能是开发者最关心的一部分。

小米官方模型卡公布的数据如下:

以上数据来自小米官方模型卡。

从这些数据能看出一个比较明显的特点:

MiMo-V2.6 的强项并不是简单写一道代码题,而是 Agentic Coding。

也就是:

读取代码仓库 ↓ 分析问题 ↓ 调用 Terminal / 工具 ↓ 修改多个文件 ↓ 执行测试 ↓ 检查结果 ↓ 继续修改

例如 DeepSWE v1.1 中,MiMo-V2.6-Pro 达到71.9,与官方模型卡列出的 Claude Opus 5 的 74.0、GPT-5.6 Sol 的 73.0 已经比较接近。

但它也不是所有榜单都领先。

例如 Terminal Bench 4.0:

MiMo-V2.6-Pro 34.9 GPT-5.6 Sol 39.9 Claude Opus 5 49.0

所以更准确的说法应该是:

MiMo-V2.6 的 Coding 和 Agent 能力已经进入当前主流旗舰模型竞争区间,但不同任务之间依然存在明显差异。

而不是简单说“全面超过 Claude / GPT”。


六、第三方榜单表现怎么样?

除了小米自己的模型卡,还可以看独立评测机构Artificial Analysis。

截至本文撰写时:

指标FlashPro
Intelligence Index3846
输出速度约51 token/s约42 token/s
每任务成本$0.06$0.13
上下文1M1M

Artificial Analysis 当前将 MiMo-V2.6-Pro 列在其开放权重模型 Intelligence Index 的#1 / 117。

小米发布时给出的更精确分数为46.32,对应 Artificial Analysis Intelligence Index v4.3。

这里一定要注意:

“Artificial Analysis 榜单第一” ≠ “所有任务都是世界第一”。

它只能说明 MiMo-V2.6-Pro 在这个综合指数及对应比较范围中表现非常突出。


七、API 价格可能才是最大的亮点

国内实时 API 价格如下:

模型缓存命中输入普通输入输出
Flash¥0.02/M¥1/M¥2/M
Pro¥0.025/M¥3/M¥6/M
Pro-UltraSpeed¥0.25/M¥30/M¥60/M

单位均为:

元 / 100 万 Token。

其中 Flash 特别夸张:

普通输入 100 万 Token 只要 1 元。

如果长期运行 Coding Agent,往往会重复传入:

  • 项目代码

  • System Prompt

  • 历史对话

  • Agent Memory

  • 工具调用结果

这时候缓存价格也非常关键。

Flash 的缓存命中输入只有:

0.02 元 / 100 万 Token。

另外,小米还提供Batch API,目前 Pro 和 Flash 的批量推理价格只有实时 API 的50%。

对于批量数据处理、模型评测、摘要和离线任务来说会更加便宜。


八、API 接入也比较简单

MiMo API 同时兼容:

  • OpenAI API

  • Anthropic Messages API

如果项目原本使用 OpenAI SDK,通常只需要修改:

API Key base_url model

OpenAI 兼容接口的 Base URL 为:

https://api.xiaomimimo.com/v1

模型名称主要使用:

mimo-v2.6-flash mimo-v2.6-pro

因此对于已有 AI 应用或者 Coding Agent 来说,迁移成本比较低。


九、MiMo-V2.6 到底好不好用?

综合目前公开数据,可以把它的优缺点概括得很清楚。

优点

1. Coding / Agent 能力强

DeepSWE、AutomationBench、Terminal Bench 等测试已经达到较高水平。

2. API 非常便宜

尤其是 Flash:

输入 ¥1/M,输出 ¥2/M。

对于需要大量 Token 的 Agent 应用很有吸引力。

3. 1M 超长上下文

适合代码仓库、长文档、Agent 历史记录和大型工作流。

4. 原生全模态

文本、图片、视频、音频可以进入同一个模型。


需要注意的地方

第一,Pro 本地部署门槛非常高。

1.02T 是完整模型参数规模,即使推理时只激活 42B,也不意味着只需要存储 42B 权重。

对于绝大多数普通用户来说,直接调用 API 更现实。

第二,普通 Pro API 的速度不是最大优势。

Artificial Analysis 当前测试约为42 token/s,并不属于最快的一档。

如果特别在意实时响应,可以考虑 UltraSpeed,但价格约为普通 Pro 的 10 倍。

第三,不要只看 Benchmark。

Benchmark 成绩并不完全等于真实开发体验。

最终还是应该比较:

任务成功率 + Token 消耗 + 运行时间 + API 成本

十、Flash 和 Pro 怎么选?

其实非常简单。

MiMo-V2.6-Flash

更适合:

  • 日常 Coding

  • 批量 API 调用

  • AI Agent

  • 数据处理

  • 自动化工作流

  • 成本敏感场景

它只有 15B 激活参数,却在很多 Agent Benchmark 中与 Pro 差距并不算特别大,而 API 价格只有 Pro 的约三分之一。

MiMo-V2.6-Pro

更适合:

  • 大型代码工程

  • 长程 Agent

  • 复杂推理

  • 科研任务

  • 多 Agent 协作

  • 对成功率要求更高的任务

Pro-UltraSpeed

适合:

对延迟非常敏感,而且愿意用更高成本换速度的生产场景。


十一、最后总结

如果用几个关键词概括 MiMo-V2.6:

MiMo-V2.6-Pro 已经在 Artificial Analysis Intelligence Index 中进入当前开放权重模型的最前列;Coding 和 Agent 相关 Benchmark 也已经能够与主流旗舰模型放在同一张表里比较。

但对普通开发者来说,我认为更值得关注的其实是MiMo-V2.6-Flash:

309B 总参数、15B 激活参数、1M 上下文、DeepSWE 67.9,普通 API 输入仅 1 元/百万 Token。

小米同时已经公开 MiMo-V2.6-Pro-RL 和 Flash-RL 权重,并采用MIT License。

所以 MiMo-V2.6 真正值得关注的地方,并不是某一项 Benchmark 有没有拿第一,而是:

它正在把模型能力、Coding、Agent、长上下文和 API 成本,同时做到一个相当有竞争力的位置。

对于 Coding Agent、大规模自动化工作流和高 Token 消耗的 AI 应用,MiMo-V2.6 已经值得实际跑一次自己的项目测试。

返回列表