仓库修复比单题编程麻烦得多。模型要读 issue 和报错日志,在目录里找到相关文件,理解函数之间的调用关系,写完补丁还要跑测试。任何一步偏离目标,后面的操作都会跟着出错。MiniCPM5-2B 在 SWE-bench Verified 上修复了 46.4% 的测试样本。
数学也很能打。AIME 2025 和 AIME 2026 都是86.5,Qwen3.5-4B 分别为 78.8 和 82.7。长文本任务 NoLiMa 上,两者是68.1对43.5;工具调用BFCL v4 是 66.6 对 56.8。OpenBMB 对搜索和多步执行投入的训练资源,也反映在 BrowseComp-ZH 与 GAIA Text-103 的领先成绩上。
代码能不能运行,数学题有没有算对,函数参数是否合规,搜索结果能否找到来源,都有明确的检查办法。OpenBMB 用这类数据训练小模型,RL 可以拿到稳定的奖励信号。2B 容量有限,清楚地判断每一步对错,比堆入更多普通文本管用。
PART 02
模型基础配置
MiniCPM5-2B 采用 42 层 Transformer,总参数约 25.17 亿,其中非词嵌入参数约 19.82 亿,原生上下文长度为 131072。OpenBMB 沿用 LlamaForCausalLM 接口,主流推理框架可以按熟悉的方式加载模型。
注意力部分用了 GQA,16 个查询头共享 2 个键值头。查询头保留表达空间,两个键值头则减少长文本推理需要保存的 KV Cache。131K 上下文会快速消耗显存,OpenBMB 用这项配置换取更长的输入和更高的并发。
OpenBMB 用42 层维持网络深度,用较少的非词嵌入参数控制主要计算量,再用 GQA 压低长上下文的缓存开销。用户在电脑上运行模型时,内存占用和解码速度比下载包大小更影响体验。
PART 03
这 2B 是怎么练出来的
MiniCPM5-2B 沿用常见的网络结构,OpenBMB 主要靠数据和后训练拉开差距。团队把训练分成基础训练、中期训练和后训练,每个阶段使用不同的数据配方。OpenBMB 还开放了 UltraX、UltraData-Code、UltraData-SFT-Agent-2609 和 UltraData-RL-2609,其中 Agent SFT 数据约 50 万条,RL 数据超过 8 万条。
训练前段先建立语言能力,中期加入代码与数学,进入后训练后,团队集中补推理、长文本和行动能力。OpenBMB 也按质量给数据分层。团队越靠近后训练,越偏向能够核对答案的样本。2B 模型容量有限,低质量 token 会挤占高价值知识的位置。
OpenBMB从 L0 原始资源开始,经过清洗、去重和质量判断,把数据送入可以训练的层级。最高一层强调答案可验证和知识可组织。代码要通过测试,数学题要能核对结果,工具调用要符合格式。小模型借助这些信号学习任务边界,RL 训练也能得到清晰反馈。
后训练花的力气更大。OpenBMB 先用 400B token 的深度思考 SFT 数据训练模型,再分别训练数学、代码、Agent 和写作等 RL 专家,最后通过 On-Policy Distillation 将 16 个专家合进一个发布模型,其中有 5 个 Agent 专家。
OpenBMB 的消融结果显示,RL 加 OPD 让推理与通用能力平均增加 10.96 分,Agent 能力平均增加 6.96 分。
OPD 训练时,多个专家先在各自擅长的任务里给出策略,学生模型沿着自己会遇到的状态学习,训练数据也随学生的行为变化。团队借此把数学、代码与 Agent 专家的经验装回同一个 2B 模型。产品上线后只需维护一个模型,调用链也会缩短。
固定答案蒸馏常会遗漏学生模型自己的错误路径。学生一旦走到教师数据没有覆盖的位置,后续动作就容易失控。On-Policy 的做法让专家围绕学生当前生成的轨迹提供反馈,训练可以碰到更多真实失误。Agent 需要连续调用工具,这种差别会积累到整条任务链上。
高质量数据提高了参数利用率,专项 RL 集中训练代码和数学,OPD 再收拢多位专家的经验。OpenBMB 用这套训练流程缩小参数差距,MiniCPM5-2B 才能在多项测试中压过 4B 模型。
PART 04
MiniCPM 系列一直在抠端侧效率
OpenBMB 在 MiniCPM4 中公开过端侧架构 InfLLM v2。系统先把 KV Cache 切成块,用语义核计算相关性并选出 Top-k,再让注意力集中到相关块、开头块和局部窗口。这套方法减少了长上下文计算。OpenBMB 的实验把注意力稀疏度推到 81%,长文本能力仍接近全注意力版本,预填充和解码也能共用这套机制。
InfLLM v2 把筛选分成两步。语义核先给各个缓存块算相关度,系统只保留与当前查询相关的候选块;注意力模块再处理候选块和附近窗口。模型无需在每个 token 上回看全部历史内容,长文档带来的计算量和缓存读取随之下降。
OpenBMB 还为同一代模型开发了UltraClean、UltraChat v2、ModelTunnel v2 和 CPM.cu。前两项处理训练数据,ModelTunnel v2 先在小模型上寻找训练策略,CPM.cu 把稀疏注意力、量化与投机采样放进推理系统。团队训练 MiniCPM4-8B 时,只用了约为 Qwen3-8B 22% 的预训练 token,综合成绩已经接近。
到了 MiniCPM5-2B,OpenBMB 继续把模型、数据、训练和推理放在一起算账。团队逐层寻找可省下的算力,比较不同数据的训练收益,再决定要把哪些专家能力蒸馏回小模型。这些选择直接影响模型速度和评测成绩。
PART 05
先把它放进代码编辑器
OpenBMB 让 MiniCPM5-2B 兼容 LlamaForCausalLM,主流推理框架可以直接加载。团队提供 BF16、GGUF、MLX 4bit、GPTQ 4bit 和 LiteRT 等版本,覆盖 vLLM、SGLang、llama.cpp、Ollama、LM Studio 与 Apple Silicon;另有 DSpark 草稿模型用于投机解码。SGLang 的 minicpm5 解析器还能把 XML 风格的工具调用转成 OpenAI 兼容的 tool_calls。
只计算模型权重,BF16 大约需要 5GB,4bit 原始权重约 1.3GB;实际运行还要给 KV Cache、激活值和推理框架留空间。相比 4B 模型,普通笔记本更容易常驻一个量化版本,边缘服务器也能用同样的显存处理更多并发。
我会先拿它做本地代码助手。它的代码分数够高,2B 体量也方便放进开发机或企业内网。代码解释、局部修改、测试生成和命令调用,都可以在源码留在本地的情况下完成。接入工作流以后,多文件修改和失败重试比榜单分数更能决定它能不能留下。
编辑器可以把当前文件、报错日志和仓库索引交给模型,模型生成补丁,再调用测试命令确认结果。2B 版本占用的资源较少,开发者不用为每次提问等待云端请求,尚未公开的代码也能留在公司网络里。
BFCL 和 BrowseComp-ZH 的成绩还给了工具型 Agent 一个机会。模型可以判断何时调用搜索、数据库或业务接口,再整理返回结果。它不用把全部知识记在参数里,2B 的运行成本更容易换来低延迟、常驻内存和离线可用。对许多端侧产品,这些体验比聊天时多背几条百科知识更实在。
PART 06
4B 依然守住了几块阵地
把 53.9 拆开看,MiniCPM5-2B 也输掉了几项。HMMT Feb 2026 上,它的 63.8 略低于 Qwen3.5-4B 的 64.0;MATH-500 是94.6 对 99.0。IFEval、MMLU-Pro、MMLU-Redux 和 GPQA-Diamond 等指令遵循与通识项目,也有更大模型排在前面。
差距最大的两项出现在高难度软件工程。SWE-bench Pro 上,MiniCPM5-2B 得到 14.4,Qwen3.5-4B 是28.2;Terminal-Bench v2.1 则是 8.6对 25.8。任务一旦拉长到更完整的工程环境,模型容量带来的优势仍然明显。
Verified 主要观察模型能否修复真实 issue,Pro 和 Terminal-Bench 要求模型完成更长的操作链,并理解更完整的工程环境。
MiniCPM5-2B 已经会写代码和修改仓库,遇到需要持续规划与多轮操作的任务,稳定性还没追上 4B。
53.9 很抢眼,但它没有抹平参数差距。MiniCPM5-2B 偏科明显,代码、搜索和工具调用是长板;知识、指令遵循和高难度工程操作,4B 仍占优势。做本地代码辅助或搜索 Agent,可以优先试 MiniCPM5-2B。任务涉及长时间终端操作时,4B 更稳。
PART 07
2B 终于能认真谈产品了
过去的端侧小模型常常停在“能跑起来”:模型可以启动,遇到复杂任务却很快露怯。MiniCPM5-2B 把代码和 Agent 分数拉高了一个档位,OpenBMB 又提供了常见的量化格式。产品团队可以把它列入本地代码助手和工具调度器的选型。
25 亿参数降低了内存压力和加载时间,OpenBMB 又用数据配方与专家蒸馏补回能力。电脑和边缘服务器可以用它做常驻代码助手,部分移动设备也有部署空间。高难度工程任务还会难住它,但这个 2B 模型已经值得进入产品选型表。
PART 08
模型下载
OpenCSG社区:
https://opencsg.com/models/OpenBMB/MiniCPM5-2B
Hugging Face社区:
https://huggingface.co/openbmb/MiniCPM5-2B
PART 09
OpenCSG vs 魔搭:如何选择?
模型部署在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
PART 10
关于 OpenCSG
OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps 是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。