十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

评测数据深度解读:MiMo-V2.6-Distill-Qwen-9B为何在SWE Pro上得分翻倍?11个关键数字说透

评测数据深度解读:MiMo-V2.6-Distill-Qwen-9B为何在SWE Pro上得分翻倍?11个关键数字说透 评测数据深度解读MiMo-V2.6-Distill-Qwen-9B为何在SWE Pro上得分翻倍11个关键数字说透【免费下载链接】MiMo-V2.6-Distill-Qwen-9B项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9BMiMo-V2.6-Distill-Qwen-9B 是小米 MiMo 团队开源的 9B 参数智能体Agentic模型通过对 Qwen3.5-9B 使用 MiMo 自生成的数据做监督微调SFT得到。它最亮眼的表现是在最难的软件工程基准SWE Pro上从基座模型的 32.0 分提升到44.6 分领先幅度在所有公开代码基准中最大。本文带你用 11 个关键数字说透这份评测数据背后的故事。先认识一下这是一个什么样的模型一句话概括它不是聊天机器人而是为动手干活而生的智能体模型。属性说明参数量9Bbf16 权重约 18.8GB分 4 个分片存储基座模型Qwen3.5-9B微调而来定位代码、通用智能体任务、视觉编码、网络安全上下文长度262144 tokens约 256K开源协议MIT模型权重分片见 model-00001-of-00004.safetensors 至 model-00004-of-00004.safetensors分片索引记录在 model.safetensors.index.json 中。它的架构很有意思config.json 中layer_types字段显示 32 层里每 4 层才用 1 层完整注意力其余都是线性注意力——这是为了长上下文下跑得更省、更快对动辄几十轮工具调用的智能体任务非常友好。更关键的是它的工作方式。打开 chat_template.jinja可以看到模型被训练成原生输出 【免费下载链接】MiMo-V2.6-Distill-Qwen-9B项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表