拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT到底是什么?How to Train Your GPT用5岁小孩都能懂的类比讲透大语言模型

GPT到底是什么?How to Train Your GPT用5岁小孩都能懂的类比讲透大语言模型 GPT到底是什么How to Train Your GPT用5岁小孩都能懂的类比讲透大语言模型【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gptGPT到底是什么How to Train Your GPT 是一个从零构建大语言模型的开源教程用像对5岁小孩说话一样的类比把 GPT 的注意力机制、训练流程和推理原理讲得明明白白。这篇文章带你用零数学基础快速看懂 GPT 是怎么读懂文字、学会预测、开口说话的。GPT到底是什么一个超级接话高手忘掉那些高深的说法GPT 的本质其实特别简单 想象你有一个读过整座图书馆所有书的朋友。你说猫咪坐在……他脱口而出垫子上。GPT 就是这么回事一台读了海量文字、学会了预测下一个词的机器。项目把它称作很聪明的下一个词猜测器next-word guesser这个定义就出自 chapters/00_overview.md。概念5岁小孩版类比GPT超级接话高手训练读几百万本书记住语言规律参数Parameters它学到的所有记忆注意力机制知道一句话里哪些词最重要文本生成永远玩不完的你续我的句子游戏而 ChatGPT、Claude、LLaMA、Mistral 这些明星模型都属于同一个架构家族——Transformer。这个教程实现的正是 LLaMA 3 风格的现代解码器架构RoPE、RMSNorm、SwiGLU也就是当前开源大模型的标准配方。一句话的完整旅程从文字到预测你输入 The cat sat on the...模型内部发生了什么就像流水线上的传送带文字要经过 5 道关卡分词Tokenizer——把句子切成小块。unbelievably 会变成 un believ ably用的是和 GPT-4 相同的 BPE 算法见 chapters/02_tokenization.md嵌入Embeddings——每个小块变成一个 768 维的数字向量从此猫和狗在数字空间里靠得很近。有意思的是向量还满足king − man woman ≈ queen见 chapters/03_embeddings.md位置编码RoPE——告诉模型词的顺序。LLaMA 选择旋转向量而不是加数字就像给每个词一个旋转角度标记见 chapters/04_positional_encoding.md注意力机制Attention——⭐ 核心中的核心让每个词看向其他词并吸收信息见 chapters/05_attention.md输出头——预测下一个词的概率然后采样一个词再喂回模型继续猜循环往复项目里有个 301 行的故事全程追踪 The cat sat on the mat. 这句话的每一步真实数字变化强烈推荐精读explanations and examples WIP/a_tokens_journey.md。注意力机制词与词之间的一场派对注意力Attention是整个大语言模型的灵魂也是大多数人最容易迷路的地方。教程用了一个绝妙的派对类比来自 explanations and examples WIP/attention.md想象你在一个嘈杂的派对上十个人同时说话。你没法平均分配注意力——你会重点听正在跟你说话的人忽略房间角落里的闲聊。大脑天然地聚焦在重要的信息上。注意力机制做的就是同样的事。每个词会给自己造三样东西Query查询我在找什么Key键我能提供什么Value值这是我真正的信息内容举个经典例子。句子是The cat sat on the mat because it was warm猫坐在垫子上因为垫子很暖和这里的it指谁人类秒懂——是垫子mat不是猫。因为暖和是垫子这种物体的属性而不是猫的属性。没有注意力的模型只能从左往右读读到 it 时早就忘记前面的 mat 了有了注意力it 可以回头看到前面所有词给 mat 更高的权重给 cat 更低的权重于是正确理解了语义。每个词还会派出 12 个注意力头像 12 位分析师从不同角度同时研究句子有的盯主谓关系有的盯介词短语有的盯句子边界。想深入原理这里有三份不同深度的资料可按需取用资料适合谁explanations and examples WIP/attention.md新手入门3词真实数字算例派对类比chapters/05_attention.md系统学习Q/K/V、缩放、因果掩码 8 步拆解notebooks/attention_visualized.ipynb动手党亲眼看着注意力权重动起来还有一个关键细节因果掩码Causal Masking——每个词只能看到它前面的词不能偷看未来就像读书时你还不知道下一页写了什么。详解在 explanations and examples WIP/causal_masking.md。GPT是怎么训练的几百万次填空纠错训练的过程像极了教小孩认字出自 chapters/08_training.md出示一个句子The cat sat on the ___让它猜缺失的词猜对了 → 好样的不用改猜错了 → 纠正它让它微调理解用几百万个句子重复几百万次每猜一次模型都会计算一个失误分——损失Loss。模型对正确答案给的概率越高损失越小模型给 mat 的概率损失值表现0.950.051几乎满分0.450.799一般0.014.605答非所问罚得最狠然后模型通过反向传播找出该拧哪个旋钮、拧多少来降低损失再由AdamW 优化器真的去拧这些旋钮也就是那几亿个参数。损失曲线一路下降就说明模型在变聪明——这就是项目训练时真实跑出来的效果这条曲线是训练健康的心电图怎么判断训练是否正常、哪里出了问题可以看 explanations and examples WIP/how_to_read_loss.md。GPT开口说话自回归生成与采样训练完成后GPT 是怎么说出答案的答案朴素得让人意外一次只生成一个词。喂入提示词 → 预测下一个词的概率分布 → 挑一个词把这个词接在原文后面 → 再预测下一个 → 无限循环为了选词GPT 用几种采样旋钮控制性格速查表见 explanations and examples WIP/cheatsheet.md参数默认值效果temperature温度0.8调低更严谨调高更天马行空top-k50只在概率最高的 k 个词里选过滤胡言乱语top-p0.9累积概率达到 p 就截断自适应筛选另外还有一个作弊神器叫KV 缓存生成第 500 个词时前面 499 个词的计算结果直接复用不用重算速度能快 500 倍以上。原理讲得很透见 explanations and examples WIP/kv_cache.md 和 chapters/09_inference.md。从零动手12章教程 28篇专题拆解看懂了原理动手才是真功夫。整个项目是12 章、7500 行的交互式教科书每一行代码都带它是什么 为什么这么写的注释只需要 Python 基础零机器学习经验也能跟。章节你将学会00_overview.mdGPT 是什么全局视角02_tokenization.mdBPE 分词文字如何变成 token05_attention.md⭐ 核心章Q/K/V 与因果掩码06_transformer_block.mdRMSNorm、SwiGLU、残差连接07_gpt_model.md组装 1.51 亿参数的完整模型08_training.md训练循环、AdamW、余弦预热09_inference.mdKV 缓存、温度、top-k/p 采样学有余力还可以挑战 fine-tuning/ 目录下的 LoRA 微调指南学习如何低成本定制自己的模型。想亲手跑起来克隆仓库即可默认是一个 1700 万参数的小模型CPU 上几分钟就能训练完成git clone https://gitcode.com/gh_mirrors/ho/how-to-train-your-gpt cd how-to-train-your-gpt pip install -r requirements.txt python main.py训练脚本入口在 main.py依赖清单见 requirements.txt。常见问题GPT 真的懂人类语言吗QGPT 内部有知识吗A更准确地说它的参数里压缩着海量文本的统计规律。它不是在查词典而是通过预测下一个词的概率分布来复现出语言。Q为什么它有时会说胡话幻觉A因为猜下一个词不等于知道事实。它会生成流畅但错误的内容这正是纯预测式大语言模型的固有限制。Q学完这个教程能读论文吗A能。教程的目标就是让你认识每一个组件——RoPE、RMSNorm、SwiGLU、KV 缓存术语都不再是黑话还能顺手参考 chapters/11_glossary.md 这份架构术语表。写在最后回到开头那个问题GPT 到底是什么它就是一台读了海量文字、无比擅长接话的预测机器——而让它聪明的是分词、嵌入、注意力、训练与采样这一整套环环相扣的机制。当你下次再打开 ChatGPT 提问时不妨回想一下那一句句回答其实是无数个猫咪坐在……垫子上式的接话游戏以每毫秒几千次的速度连成了河。正如项目 README 里那句话任何被讲得足够透彻的技术都与魔法无异——除非你自己把它造出来。现在去把属于你的那台 GPT 造出来吧 【免费下载链接】how-to-train-your-gptBuild a modern LLM from scratch. Every line commented. Explained like we are five.项目地址: https://gitcode.com/gh_mirrors/ho/how-to-train-your-gpt创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表