
一、SGLang 是谁从 LMSYS 到 40 万 GPUSGLangStructured Generation Language最初由 LMSYS 团队于 2023 年底提出arXiv:2312.07104定位是高效执行结构化语言模型程序的系统。它由两部分组成前端语言frontend用装饰器/原语如.gen()、.fork()、gen()描述生成与并行控制把复杂的多分支/结构化生成写成程序。运行时runtime跑这些程序时做系统级优化。到 2026 年它已经从一个研究原型成长为生产级推理引擎据第三方仓库统计仓库约3.57 万 Star2026-09-09官方/行业口径称其部署在40 万 GPU上生产用户包括 xAI、NVIDIA、AMD、Intel、LinkedIn、Cursor、Oracle/Google/Microsoft/AWS 云。甚至有衍生公司RadixArk从该项目独立出来专门把它跑在 AMD GPU 上。NVIDIA 的 GTC26 演讲也把 SGLang 列为高性能 serving/training 的关键路由引擎。它和前几篇讲过的 vLLM9/7 篇是什么关系一句话vLLM 靠 PagedAttention 把 KV Cache 分页管理SGLang 多走一步把 KV Cache 组织成基数树做跨请求前缀复用。二、灵魂创新RadixAttention2.1 问题重复的前缀在白算传统推理引擎把每个请求独立对待——你给什么 prompt我就从空开始把整个 prompt 做一遍 prefill算出它的 KV Cache。但现实里大量请求共享公共前缀多轮对话每轮都带着完全相同的 system prompt 历史对话。Few-shot 提示一批请求共用同样的示例模板。Agent 工具链 / RAG长 system 上下文被反复复用。如果每个请求都重算这部分 KV就是巨大的浪费。2.2 解法把 KV Cache 挂进基数树RadixAttention 的做法把所有历史请求的 KV Cache按 token 序列存进一棵基数树radix tree / Patricia trie。新请求进来时运行时从树根往下走逐 token 匹配已有节点每匹配上一个节点说明这段 token 的 KV 早就躺在显存里了零额外 prefill 计算。只有匹配不上的后缀部分才真正跑新计算。据 SGLang 官方/行业基准在多轮对话和 Agent 负载上这种前缀缓存命中率可超过 80%论文初版报告其在常见负载上比 Guidance/vLLM 吞吐最高提升约 5 倍。2.3 为什么是基数树而不是 hash map因为前缀复用是最长公共前缀问题基数树天然支持前缀匹配从根往下走匹配到哪停到哪。共享/分叉公共前缀只存一份分支处才复制——空间也省。淘汰evictionLRU 策略整棵子树回收显存。这正好契合多轮对话前缀越长越共享的访问模式。三、运行时的其他关键部件RadixAttention 是灵魂但 SGLang 能打靠的是一整套运行时优化部件作用对应 vLLM 概念连续批处理continuous batching调度器动态把 prefill/decode 请求拼进同一批连续批处理相同CUDA Graphs捕获并回放 decode 步压掉 CPU 开销CUDA GraphsPD 分离Prefill-Decode disaggregationprefill 与 decode 拆到不同资源池分离式部署投机解码EAGLE 草稿模型 ngram 投机投机解码结构化输出XGrammar压缩有限状态机加速受限解码结构化输出多卡并行Tensor / Pipeline 并行MoE 优化张量并行3.1 结构化输出XGrammar大模型经常要只能输出合法 JSON / 符合某个正则 / 符合 GBNF 语法。朴素做法是每生成一个 token 就用约束器屏蔽非法 token——开销不小。SGLang 把这个约束编译成压缩有限状态机compressed FSM用 XGrammar 高效跑让结构化生成几乎不损失吞吐。这也是它名字里 Structured Generation 的由来。3.2 投机解码decode 阶段 memory-bound单步产一个 token 利用率低。SGLang 支持EAGLE用一个小草稿模型先猜一串主模型并行验证和ngram 投机从已生成内容里找重复块直接抄把 decode 吞吐再往上抬。四、串联国产模型DeepSeek / GLM 生产部署SGLang 对国产开源模型的支持是首日级的这也是它在国内开发者圈火的原因模型SGLang 支持DeepSeek V3 / R1首日支持NVIDIA/AMD GPU 专项优化2025-01 起DeepSeek V42026-04-24 以 MIT 协议发布SGLang 官方有部署 cookbook0731 Flash / 0813 Pro 刷新带 DSpark 草稿头GLM-4.5 / 4.6FP8 支持v0.5.192026-09-05为 GLM-4.5 FP8 在 GB300 上加 MoE 配置decode 吞吐21.9%4.1 一条命令起服务实战# 用 SGLang 起一个 OpenAI 兼容的推理服务 python -m sglang.launch_server \ --model-path deepseek-ai/DeepSeek-V3 \ --tp 4 \ # 4 张量并行 --enable-radix-cache \ # 开启 RadixAttention 前缀复用 --host 0.0.0.0 --port 30000起好后就是 OpenAI 兼容 API可以直接用openaiSDK 打。配合--enable-radix-cache多轮对话和 system prompt 复用的收益会非常明显——这正是 Agent/RAG 类应用最需要的。4.2 什么时候选 SGLang 而不是 vLLM场景推荐纯单轮、无共享前缀两者都行vLLM 生态更全多轮对话 / Agent / RAG / 长 system前缀命中率高SGLang 优势明显RadixAttention 白捡的吞吐严格结构化输出JSON/GBNFSGLang 的 XGrammar 更成熟已用 Triton Inference Server 套壳SGLang 可作 Triton backend五、与系列前作串成一张图到这里AI 开源推理基建这条线已经讲了一整套正好闭环Ollama9/10 篇本地跑GGUF/llama.cpp。vLLM9/7 篇服务端 PagedAttention。SGLang本篇服务端 跨请求前缀复用 结构化生成。LiteLLM9/8 续篇上面的统一网关。从造到跑到喂到接一条完整的推理基建链路。六、总结SGLang 的灵魂是 RadixAttention把 KV Cache 挂进基数树跨请求复用公共前缀Agent/多轮场景命中率 80%论文级最高约 5 倍吞吐。不是单点优化而是整套运行时连续批处理 CUDA Graphs PD 分离 EAGLE/ngram 投机 XGrammar 结构化输出。国产模型首日支持DeepSeek V3/R1/V4、GLM-4.5/4.6 都是一等公民v0.5.19 还在持续为国产模型加 kernel 优化。选型建议前缀复用/结构化输出重的场景选 SGLang纯单轮通用场景 vLLM 也够。推理引擎的竞争本质是谁能把已算过的东西少算几遍。SGLang 用一棵基数树把这句话做到了极致。参考资料SGLang 论文 arXiv:2312.07104Efficient Execution of Structured Language Model ProgramsRadixAttention、压缩 FSM. https://arxiv.org/pdf/2312.07104v2 一级2023-12SGLang 官方文档High-performance servingRadixAttention / prefix caching / DeepSeek-V4 cookbook. Welcome to SGLang - SGLang Documentation 一级2026-09-08/11 更新gstars.devsgl-project/sglang 仓库统计约 35,689 Star2026-09-09DeepSeek V3/R1 首日支持. sgl-project/sglang – Stars, Activity Insights | GStars.dev 三级2026-09-09AI WikiSGLang40 万 GPU、生产用户 xAI/NVIDIA/AMD/Cursor. SGLang | AI Wiki 三级2026-07llmsystem 2025 课件Efficient LLM Inference with SGLangRadixAttention 基数树、DeepSeek 部署案例. https://llmsystem.github.io/llmsystem2025spring/assets/files/llmsys-25-sglang-72edc5043338f59db34d47e5b96ac870.pdf 二级DigitalOceanWhat Is SGLang 2026 Guide30k stars、Triton backend、RadixArk. What Is SGLang? 2026 Guide to the LLM Serving Framework | DigitalOcean 二级2026-09-10SGLang v0.5.19 ReleaseGLM-4.5 FP8 GB300 decode 21.9%2026-09-05. https://newreleases.io/project/github/sgl-project/sglang/release/v0.5.19 二级2026-09-05RunpodSGLang in ProductionRadixAttention 前缀复用设计. SGLang in Production for LLM Pipelines 二级2026-09-11