十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Triton-Puzzles 完整入门指南:12道交互式谜题从零学会GPU编程,无需显卡也能跑

Triton-Puzzles 完整入门指南:12道交互式谜题从零学会GPU编程,无需显卡也能跑 Triton-Puzzles 完整入门指南12道交互式谜题从零学会GPU编程无需显卡也能跑【免费下载链接】Triton-PuzzlesPuzzles for learning Triton项目地址: https://gitcode.com/gh_mirrors/tr/Triton-PuzzlesTriton-Puzzles是一个用12 道交互式谜题教你从零学会GPU 编程的开源项目它基于开源语言 Triton配合可视化调试工具让你用纯 CPU 解释器就能在本地或 Colab 上无需显卡完成全部谜题从最简单的向量加法一路练到 FlashAttention 与 4-bit 量化矩阵乘法。什么是 Triton-Puzzles写 GPU 程序通常需要学习 CUDA 这类专有语言门槛很高。而Triton是 OpenAI 开源的一种更高层的 GPU 编程语言语法和 NumPy / PyTorch 非常相似却能直接编译到 GPU 等加速器上。Triton-Puzzles把学会 Triton拆成了 12 道由浅入深的谜题Puzzle。你只需用tl.load读内存和tl.store写内存两个原语动手写代码并通过自动测试验证结果。所有谜题都运行在Triton 解释器中因此无需 GPU 也能跑笔记本、Colab 免费额度都可以轻松完成。项目核心就是一个 Notebook附带 12 道谜题与完整测试代码谜题与测试主体Triton-Puzzles.ipynb项目说明README.md开源许可LICENSE3分钟快速开始无需显卡的运行步骤第一步克隆仓库git clone https://gitcode.com/gh_mirrors/tr/Triton-Puzzles cd Triton-Puzzles第二步安装依赖Notebook 第一个单元格会自动执行%%capture安装手动安装则等价于pip install torch triton jaxtyping pip install githttps://github.com/Deep-Learning-Profiling-Tools/triton-viz第三步打开 Notebook 逐格运行在 Colab 中直接打开 Triton-Puzzles.ipynb点击 Open In Colab 徽章即可本地用 Jupyter 打开后依次运行 Setup 单元格其中定义了test测试函数和triton_viz_launch可视化启动函数。每做完一道谜题调用test(...)即可验证答案是否正确。 本地运行时把 Notebook 中的triton_viz.launch(shareTrue)换成triton_viz.launch(shareFalse)可视化界面会直接开在你的浏览器里。12道谜题全景你的GPU编程闯关路线图 ️谜题难度呈清晰的阶梯式分布前 2 道热身、中间 4 道进阶、最后 6 道挑战真实算法。#谜题你将学到的核心概念1Constant Add常量加法tl.load/tl.store基础操作2Constant Add Block块Block分块处理长向量3Outer Vector Add二维外积加法行/列广播4Outer Vector Add Block双 program 轴的分块并行5Fused Outer Multiplication算子融合 ReLU6Fused Outer Mult - Backwards链式法则求导反向传播7Long Sumfor 循环处理长序列8Long Softmax数值稳定 softmax、exp2技巧9Simple FlashAttentionFlashAttention 单遍在线求和10Two Dimensional Convolution批量化 2D 卷积11Matrix Multiplicationtl.dot分块矩阵乘法12Quantized Matrix Mult4-bit 量化权重解码与计算谜题实战第1题常量加法怎么做第 1 题要求给长度为N0的向量每个元素加 10即z_i 10 x_i。思路非常直观用tl.arange(0, B0)生成块内偏移索引用tl.load(x_ptr range, mask, 0)读入数据——因为 Triton 的形状必须是2 的幂所以第二个参数 mask 用来屏蔽越界元素加 10 之后用tl.store(z_ptr range, value, mask)写回。卡住时把光标停在可视化界面的代码行上就能实时看到哪些内存格子被读、被写——这是这套谜题交互式的核心所在。高级谜题亮点FlashAttention 与 4-bit 量化从第 8 题开始进入真·算法阶段这正是GPU 编程最有价值的部分第 8 题 Long Softmax必须像 Python 那样做数值稳定处理先减最大值并且官方建议用exp2代替exp——你需要用到恒等式exp(x) 2^(x·log₂e)。进阶玩家可以用 2 个循环而非 3 个循环完成第 9 题 Simple FlashAttention标量版 FlashAttention要求单循环在线求和这正是大模型推理加速的关键算法第 12 题 Quantized Matrix Mult模拟量化神经网络——权重以4-bit存储32-bit 整数里塞 8 个权重每组权重配 1 个 scale 和 1 个 shift你需要先解包 4-bit 数值再参与矩阵乘法完整还原真实量化推理的计算链路学习建议如何高效通关 12 道谜题先跑通 Introduction 演示Notebook 开头的 Introduction 部分演示了tl.load/tl.store和分块示例务必配合 triton-viz 把每个格子看一遍小步验证每写完一段就调用test(puzzle, puzzle_spec, ...)测试函数会打印张量形状标注形状不对立刻能发现善用 mask所有块大小 ≠ 数据长度的题目第 2、4、7~12 题都离不开 mask 处理边界按阶梯推进不要跳过第 7~8 题的循环技巧直接做 FlashAttention第 9 题的解法直接复用了第 8 题的在线求和技巧。项目文件结构与延伸整个仓库非常轻量只有 3 个文件适合一次读完Triton-Puzzles.ipynb全部 12 道谜题、演示与测试约 2MB含内嵌示意图README.md项目介绍与运行方式LICENSE开源许可它是交互式谜题学系统系列的第 7 作同作者还有 GPU 缓存谜题、Transformer 谜题等系列学完本篇后可以继续拓展GPU 编程知识版图。总结Triton-Puzzles用12 道渐进式谜题 可视化调试把GPU 编程从劝退级难度拉低到闯关级体验无需显卡、语法接近 NumPy、从tl.load一路练到 FlashAttention 和量化矩阵乘法。打开 Triton-Puzzles.ipynb今天就能开始第一关。【免费下载链接】Triton-PuzzlesPuzzles for learning Triton项目地址: https://gitcode.com/gh_mirrors/tr/Triton-Puzzles创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表