
一、传统 LLM 的三阶段训练预训练 → SFT → RLHF这是目前绝大多数通用大语言模型的标准成长路径。1. 预训练Pre-training读万卷书本质让模型在海量无标注文本网页、书籍、代码等上学习语言的统计规律和世界知识。过程输入数万亿 token 的互联网文本目标预测下一个词Next Token Prediction结果模型学会了语法、常识、逻辑但输出可能混乱、有害、不符合人类偏好DeepSeek 案例DeepSeek-V3 在 14.8T tokens 上预训练耗资约 557 万美元。此时它是一个知识容器能续写文本但不会对话。2. SFTSupervised Fine-Tuning监督微调拜师学艺本质用高质量的人工标注问答对Prompt 理想回答来教模型人类希望你怎么回答。过程输入数十万到数百万条精心编写的对话数据如请写一首关于春天的诗→春眠不觉晓…目标让模型模仿这些高质量回答的风格、格式和 helpfulness结果模型从文本续写器变成对话助手关键点SFT 是监督学习——有明确的标准答案Ground Truth模型通过模仿来学习。DeepSeek 案例DeepSeek-V3 预训练后经过多轮 SFT学会了遵循指令、保持礼貌、生成结构化回答。3. RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习社会打磨本质用人类的偏好评价来进一步微调模型让它不仅答得对还要答得好更有用、更无害、更诚实。过程第一步训练一个奖励模型Reward Model——让人类标注员对同一问题的多个回答打分A比B好奖励模型学会预测人类会喜欢哪个回答第二步用强化学习算法如 PPO优化语言模型目标是让奖励模型给出的分数越来越高结果模型学会了讨好人类偏好——拒绝有害请求、承认不知道、给出更详细的解释关键点RLHF 是强化学习——没有标准答案只有好/更好的反馈信号模型通过试错和优化来提升自己。DeepSeek 案例DeepSeek-V3 经过 RLHF 后会拒绝生成违法内容会主动说明我的知识截止到 2024 年语气也更自然。二、推理模型的训练路径预训练 → 纯 RL → SFT 对齐DeepSeek-R1 走了一条反直觉的路它把强化学习放到了核心位置甚至在没有大量人工标注推理数据的情况下让模型自己悟出了推理能力。1. 预训练同样的起点和 V3 一样R1 的底座是 DeepSeek-V3-Base预训练后的基础模型。此时它有语言能力但没有显式的深度推理能力。2. 纯 RL 驱动推理Pure RL-driven Reasoning自我觉醒本质不给模型标准答案只给规则化的奖励信号让模型通过海量试错自己学会怎么思考。DeepSeek-R1 的具体做法阶段 ACold Start冷启动 SFT先收集几千条高质量的长思维链CoT数据对 Base 模型做一次小规模 SFT目的给 RL 一个稳定的起点避免模型在 RL 初期乱来阶段 BReasoning-Oriented RL面向推理的强化学习使用GRPOGroup Relative Policy Optimization算法奖励信号极其简单只有两个准确性奖励数学题的答案对不对可自动验证格式奖励是否按规定的格式输出如把推理过程放在think标签内没有人类标注的推理过程神奇的事情发生了模型在试错中自发学会了把复杂问题拆解成子问题尝试不同解法并验证发现错误后自我修正“Wait, let me check this again…”生成越来越长的思维链关键点这是“纯” RL——不依赖人类标注的推理数据奖励信号完全来自可自动验证的规则如数学题答案是否正确。3. SFT 对齐SFT Alignment能力整合本质把 RL 阶段涌现出的推理能力固化下来同时补充通用能力防止模型变成只会做题的偏科生。DeepSeek-R1 的具体做法阶段 CRejection Sampling SFT拒绝采样与监督微调从 RL 训练后的模型中用拒绝采样筛选出 60 万条高质量推理轨迹只保留答案正确的长 CoT混合 20 万条 V3 的非推理数据写作、翻译、简单问答等对模型进行第二轮 SFT阶段 DRL Alignment全场景对齐最后阶段引入人类偏好奖励类似 RLHF对齐 helpfulness 和 harmlessness同时保留推理能力三、两条路线的核心区别维度传统 LLMV3 路线推理模型R1 路线核心哲学模仿人类写的答案自己探索解题策略SFT 的作用主要学习手段数据量巨大辅助手段数据量小且经过严格筛选RL 的作用最后一步微调偏好核心驱动力让模型自发涌现推理奖励信号人类偏好主观、模糊规则验证客观、精确如数学题对错数据依赖极度依赖海量人工标注极度依赖可自动验证的任务适用任务开放域对话、创意写作数学、代码、逻辑推理四、一句话总结预训练 读万卷书学知识SFT 拜师学艺学格式RLHF 社会打磨学做人纯 RL 闭关顿悟学会思考SFT 对齐 融会贯通既会思考也会聊天DeepSeek-R1 的革命性在于它证明了深度推理能力不需要人类手把手教只要给模型一个对/错的判卷机它就能自己悟出来。这也是为什么 R1 的训练成本远低于 OpenAI o1却能取得相近甚至更好的推理效果——它绕过了最昂贵的人工标注推理数据环节。