十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

深入读懂 Kimi K2:1T 参数 MoE 模型与 MuonClip 优化器完整上手指南

深入读懂 Kimi K2:1T 参数 MoE 模型与 MuonClip 优化器完整上手指南 深入读懂 Kimi K21T 参数 MoE 模型与 MuonClip 优化器完整上手指南【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2Kimi K2 是 Moonshot AI 开发的混合专家MoE大语言模型总参数 1 万亿每次推理只激活 320 亿在 15.5 万亿 tokens 上完成预训练且训练过程零不稳定。这篇文章带你把 MuonClip 优化器的原理、模型架构和部署路径一次讲透。MuonClip 是什么驯服万亿参数的优化器 训练大模型像在山路开车优化器是方向盘参数是车身——车越大越容易跑偏。Muon 是一类较新的优化器Moonshot 把它应用到了前所未有的规模并针对扩展中出现的梯度失稳问题补充了一组新技巧合称 MuonClip。它解决的是一个很具体的问题1 万亿参数的 MoE 模型吃下 15.5T tokens 时梯度更新稍放大就可能发散规模越大越容易踩坑。用上 MuonClip 后整个预训练过程没有出现训练不稳定这是 Kimi K2 能走完大规模训练的前提。看懂架构的 3 个数字32B、384、128K MoE 像医院分诊科384 位专家子网络每个 token 由路由挑出 8 位外加 1 位常开的共享专家。所以单 token 只激活 32B 参数模型总容量却做到 1T。项目数值总参数1T激活参数32B层数含 1 个密集层61注意力隐藏维度7168MoE 隐藏维度每专家2048注意力头数64专家数量384每 token 选择专家数8另加 1 个共享专家词汇表大小160K上下文长度128K注意力机制MLA激活函数SwiGLU4 步跑起 Kimi K2 本地部署 克隆仓库git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2下载权重checkpoint 以 block-fp8 格式存放于 Huggingface 的 Kimi-K2-Instruct 仓库通用对话与 Agent 场景选 Instruct继续训练选 Base。选推理引擎推荐 vLLM、SGLang、KTransformers 或 TensorRT-LLMFP8 权重 128K 上下文的最小部署单元是 16 卡H200/H20集群。启动服务vLLM 与 SGLang 的启动命令、张量并行/专家并行参数见 部署指南工具调用的流式输出解析见 工具调用指南。一个小细节官方推荐 Kimi-K2-Instruct 的采样温度设为temperature 0.6。延伸阅读完整技术报告tech_report.pdf授权条款LICENSE代码与权重均采用 Modified MIT 协议发布【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表