MiniMind 学习笔记(八):Pretrain 训练导言——从"模型是什么"到"模型怎么训"
终于进入激动人心的训练部分了。前面几节回答的都是"模型是什么",但只知道定义和真正把模型训练出来,中间还隔着很长一段路。这一章把 MiniMind 当成一个最小但完整的观察窗口,通过它理解 pretrain 的核心问题和常见坑。
文章目录
- MiniMind 学习笔记(八):Pretrain 训练导言——从"模型是什么"到"模型怎么训"
- 前言:为什么训练部分值得单独成章
- 一、先说明边界:小模型经验不能直接外推
- 二、QA 式组织:训练部分最适合从问题出发
- 三、两条主线:理论问题 + 实际操作
- 3.1 理论部分:五个核心问题
- 3.2 实际操作部分:让训练稳定跑起来
- 3.3 回到 MiniMind 实际训练流程
- 四、一条最重要的建议:先跑起来再读
- 总结
- 参考
前言:为什么训练部分值得单独成章
前面几节更多是在回答"模型是什么":Language Model 是什么、Transformer 是什么、Attention 怎么算、Tokenizer 如何把文本变成 token id。可是只知道这些定义,和真正把一个模型训练出来,中间还隔着很长的一段路。
这也是 MiniMind 很有价值的地方:它不只是给出一段模型结构代码,而是提供了一个真实、完整、又足够小的训练入口。
很多人(包括原作者)都有过这样的体验:通过 NLP 课程和各种文章学过很多概念——语言模型、交叉熵、优化器、学习率、梯度下降。单独看每个概念,好像都能理解;但一旦离开上下文,很快又会变得模糊。直到真正跑起 MiniMind 的 pretrain 流程,这些东西才开始连成一条线。
模型训练本身是一件非常复杂的事情。它当然有理论基础,但工程上还有大量经验性的细节:
- 数据怎么组织?
- loss 怎么算?
- 学习率怎么调?
- 梯度为什么会爆?
- 混合精度为什么会出 NaN?
- 断点恢复到底保存了什么?
- 训练日志里哪些指标真正值得看?
这些问题如果只停留在抽象层面,很难形成直觉;只有真的训练一次,才会发现训练不是"调用一个脚本"这么简单。
一、先说明边界:小模型经验不能直接外推
这一章的讨论主要基于MiniMind 这样的个人可复现实验,以及一类相对小规模的模型训练经验。
对于真正工业级的大模型,训练规模、数据规模、并行策略和工程复杂度都会高很多。所以这一章里的结论不能直接外推到所有大模型训练场景。
更合理的态度是:
把 MiniMind 当成一个最小但完整的观察窗口,通过它理解 pretrain 的核心问题和常见坑。
| 维度 | MiniMind 级别 | 工业级大模型 |
|---|---|---|
| 训练规模 | 个人可复现 | 千卡集群 |
| 数据规模 | GB 级 | TB ~ PB 级 |
| 并行策略 | 单卡 / 简单并行 | 数据/张量/流水线并行组合 |
| 工程复杂度 | 一个脚本 | 完整训练基础设施 |
二、QA 式组织:训练部分最适合从问题出发
这一章仍然用 QA 的方式组织。因为训练部分最适合从问题出发:
- 为什么 pretrain 的 loss 是交叉熵?
- 为什么不是 BCE?
- 为什么要做梯度累积?
GradScaler到底在缩放什么?- loss 下降是不是就代表模型变好了?
这些问题看起来很细,但它们恰好组成了训练代码里最关键的骨架。
三、两条主线:理论问题 + 实际操作
这一节之后,Pretrain 训练部分会先按"理论问题"和"实际操作"两条线展开。
3.1 理论部分:五个核心问题
| # | 主题 | 核心问题 |
|---|---|---|
| 1 | 损失函数 | pretrain 为什么是 next token prediction?为什么用 Cross Entropy Loss?代码里的loss_mask如何影响 loss? |
| 2 | 优化器 | 参数更新到底在做什么?为什么大模型训练里常见的是 AdamW? |
| 3 | Learning Rate | 学习率为什么重要?为什么需要 schedule?MiniMind 里的 cosine decay 对应什么含义? |
| 4 | 数据设置 | 数据集质量、数据分布、max_seq_len、padding、truncation、batch size 和有效 batch size 会如何影响训练? |
| 5 | 评估 | training loss、validation loss、perplexity 和生成样例分别能说明什么? |
这些内容会拆成不同小节:Loss单独成节;优化器、学习率和数据设置放在一节;Eval也单独成节。
3.2 实际操作部分:让训练稳定跑起来
实际操作部分更关注训练能不能稳定跑起来:
- 分布式训练
- 混合精度(AMP)
- 梯度累积
- 梯度缩放(GradScaler)
- 梯度裁剪
- seed
- checkpoint
- 可视化
- 断点恢复
这些内容不只是工程实现,也常常是训练中最容易踩坑的地方——比如混合精度为什么出 NaN、断点恢复到底保存了什么,都是理论书籍里讲得少、动手时一定会遇到的问题。
3.3 回到 MiniMind 实际训练流程
最后再回到 MiniMind 的实际训练流程,记录:
- 数据准备
- 训练命令
- 输出目录
- 实验现象
四、一条最重要的建议:先跑起来再读
我也建议在阅读训练部分之前,先把 MiniMind 的最小训练流程跑起来。
哪怕模型效果很弱,哪怕输出还前言不搭后语,只要完整跑过一次,后面再看 loss、optimizer、AMP、checkpoint 和 eval,就会有完全不同的感觉。
这与开篇「GettingStarted」的思路一脉相承:对一个项目,最好的办法是最快地把它跑起来——先不纠结细节,把环境搭好、把代码跑起来,再慢慢去理解它的细节和原理。
总结
本篇作为 Pretrain 训练部分的导言,核心要点:
- 定义 ≠ 训练:知道"模型是什么"和把模型训出来,中间隔着数据、loss、优化器、稳定性等一长串工程细节;
- MiniMind 的价值:一个真实、完整、又足够小的训练入口,是概念连成线的最佳载体;
- 边界意识:个人级实验经验不能直接外推到工业级大模型训练;
- QA 驱动:为什么是交叉熵不是 BCE、GradScaler 在缩放什么、loss 下降是否等于变好——这些细问题恰是训练代码的骨架;
- 两条主线:理论(Loss / Optimizer / LR / 数据 / Eval)+ 操作(AMP / 梯度累积 / checkpoint / 断点恢复);
- 行动建议:读理论之前,先把最小训练流程完整跑一遍。
下一篇开始进入 Loss 专题:为什么 pretrain 的损失函数是交叉熵,loss_mask又是如何影响 loss 的。后续章节的笔记均已发布:
| 顺序 | 章节 | 对应笔记 |
|---|---|---|
| 9 | Pretrain 的训练目标和 Loss | 从 NTP 到交叉熵的本质(CE/KL/BCE 关系、严格推导、loss_mask) |
| 10 | 优化器、学习率和数据设置 | 初始化/Warmup/Cosine、AdamW 推导、Lion/Muon、Scaling Law、batch 计量体系 |
| 11 | Pretrain 的实施细节和常见坑 | DDP、混合精度三件套、梯度累积、checkpoint 断点恢复、可视化 |
参考
- llm-notes-all-in-one: Pretrain 训练导言
- llm-notes-all-in-one 仓库
- MiniMind 上游仓库