SGLang
高性能LLM/多模态推理服务框架:RadixAttention前缀缓存、投机解码、PD分离,DeepSeek/Kimi/GLM等新模型day-0支持,Apache-2.0
这是什么?适合谁?
SGLang(sgl-project/sglang,32.2k Stars,Apache-2.0)是一个高性能大模型与多模态模型推理服务框架,出自 LMSYS 团队系(Slack 社区 + 每周开发者会议),与 vLLM 同属”生产级推理引擎”赛道。核心卖点:极致吞吐(官方在 NVIDIA GB300 NVL72 上宣称 25x 推理性能)、对最新开源模型的 day-0 支持(DeepSeek-V4、Kimi K3、GLM5.2、Nemotron 3 系列等发布当天即支持)、RadixAttention 前缀缓存、投机解码(DFlash/Spec V2 一代)、以及 2026 年起的 SGLang Diffusion(视频/图像生成加速)。
它解决的是”开源模型部署的最后一公里”:把 checkpoint 变成高吞吐、低延迟、可并发的线上服务。README 的 News 区显示它已从纯 LLM 推理扩展到 TPU(与 Google 合作)、多模态(Higgs Audio v3 TTS)与扩散模型加速。
适合人群:
- 推理服务提供方(API 平台/内部模型平台):需要榨干 GPU 利用率的大流量场景
- 跟进最新开源模型(DeepSeek/Kimi/GLM/Qwen 等)的团队:day-0 支持意味着不用自己适配
- Agent 工作流平台:RadixAttention 对”系统提示词长且复用”的 Agent 场景有天然加成
- 研究者:需要可复现、可控的推理基准环境
不适合:只想调用闭源 API 的应用开发者(用 LiteLLM 等网关更合适);没有 GPU 资源的个人用户(本地小模型推理用 Ollama 更省心)。
使用前提:NVIDIA GPU(A100/H100/Blackwell 等,TPU 走 SGLang-Jax 后端);Python 环境;对 CUDA/容器有基本操作能力。
准备工作
- 硬件:至少一张数据中心级 GPU(消费级卡可跑小模型但非设计目标);Blackwell/CUDA 环境按官方文档对版本
- 软件:Python 3.9+;PyTorch(官方镜像已打包依赖);Docker(推荐用官方镜像省去环境地狱)
- 时间预算:官方镜像拉起服务 10 分钟内;性能调优(并发/缓存/KV 预算)需要额外半天起步
- 成本:Apache-2.0 完全开源免费;成本主要是 GPU(自购或云租用)
- 模型:HuggingFace 格式 checkpoint(DeepSeek/GLM/Qwen/Llama 系等主流模型均支持)
快速上手(3 步)
第一步:安装
# 方式 1:pip(基础安装)
pip install --upgrade pip
pip install "sglang[all]"
# 方式 2:Docker(推荐,环境最稳)
docker pull lmsysorg/sglang:latest
第二步:启动服务
python -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V3 \
--port 30000 --host 0.0.0.0
# Docker 等价:
docker run --gpus all --shm-size 32g -p 30000:30000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
--env "HF_TOKEN=你的token" \
lmsysorg/sglang:latest \
python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-V3 --port 30000
服务起来后提供 OpenAI 兼容 API(/v1/chat/completions、/v1/completions)。
第三步:发起请求并验证
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "deepseek-ai/DeepSeek-V3", "messages": [{"role": "user", "content": "用一句话介绍 RadixAttention"}]}'
成功判定:启动日志出现 “The server is fired up and ready to roll!”(官方口径);curl 返回合法 JSON 且首 token 延迟符合预期;/health 端点可访问。
初级用法
- OpenAI 兼容接入:现有 OpenAI 客户端只改 base_url,存量应用零改造
- 批量离线推理:
sglang.batch_infer或离线 engine 模式跑数据集评估 - 多模型切换:换
--model-path即可切换支持的 checkpoint - 基础并发调参:
--max-running-requests、--mem-fraction-static控制并发与显存水位
高级玩法
- RadixAttention 前缀缓存:系统提示词/多轮对话历史自动命中缓存,Agent 与”固定 prompt 模板”场景吞吐倍增;用
--radix-cache相关参数控制策略 - 投机解码:新一代 DFlash/Spec V2(官方 2026-06 博客),小模型起草+大模型校验,解码吞吐显著提升,按模型支持情况开启
- PD 分离与大规模 EP:prefill/decode 分离部署(官方 GB200 部署博客给出现成拓扑),大集群场景的吞吐与延迟调优路线图
- 结构化输出:约束 JSON Schema 输出,配合 Agent 工作流直接产出可解析的工具调用
- SGLang Diffusion:视频/图像生成模型的推理加速(2026 年新方向),同一服务形态托管扩散 workload
常见踩坑(5 条)
踩坑 1:启动直接 OOM
- 现象:模型加载阶段 CUDA out of memory
- 原因:KV cache 显存预算默认激进,与权重加载叠加超了卡的实际显存
- 解决:调低
--mem-fraction-static;换张量并行--tp 8分摊;确认卡型支持的精度(FP8/FP4)已开启
踩坑 2:模型不支持报错
- 现象:某 checkpoint 报架构不支持
- 原因:模型发布早于该版本 SGLang 的架构支持
- 解决:升级到最新版(day-0 支持策略意味着新模型要配新版本);查官方 Slack/issue 确认支持矩阵
踩坑 3:Docker 里 NCCL/共享内存炸
- 现象:多卡张量并行启动失败或训练中 hang
- 原因:容器
--shm-size默认太小,多卡通信放不下 - 解决:
--shm-size 32g(或更大)+--gpus all,参照官方 Docker 文档
踩坑 4:并发上去延迟雪崩
- 现象:压测时 P99 延迟暴涨
- 原因:
--max-running-requests无限制时调度器过载,KV cache 换入换出频繁 - 解决:按 SLA 反推限流参数;开启 chunked prefill;配合监控观察 KV 命中率
踩坑 5:拿官方 25x 数字做采购承诺
- 现象:自建环境复现不出宣传吞吐
- 原因:25x 是 GB300 NVL72 大集群 + 特定 workload 的官方口径(2026-02 博客),与单卡场景不可比
- 解决:用自己的 prompt 长度分布/并发模型在目标硬件上实测基准再下结论
小技巧(5 条)
- 先看官方 benchmark 复现条件:每篇性能博客都写明了硬件与 workload,对齐条件再对比
/health与日志探活:把 “fired up and ready” 纳入部署健康检查- 预下载 checkpoint:
huggingface-cli download提前拉模型,避免服务启动时等网络 - 每周开发者会议公开:遇到适配问题先搜会议纪要/Slack,多数 day-0 支持的坑社区已有答案
- 结构化输出 + Agent 模板化 prompt:两者叠加(长前缀命中 RadixAttention + JSON Schema 约束)是 Agent 服务化的黄金组合
常见问题 FAQ
Q1:SGLang 免费吗?
A:Apache-2.0 开源,完全免费(32.2k Stars,2026-08-21 采集)。成本在你自己的 GPU。
Q2:和 vLLM 怎么选?
A:同赛道双雄。vLLM(本站已收录,86k+ Stars)生态更早更大;SGLang 的差异化是最新开源模型的 day-0 支持、RadixAttention 前缀缓存、投机解码新方案与 TPU/扩散扩展。建议用你自己的模型与 workload 跑一轮对比再定。
Q3:支持哪些模型?
A:主流开源系(DeepSeek/GLM/Qwen/Llama/Mistral/Nemotron 等)与多模模型;day-0 支持记录见官方博客 News 区(Kimi K3、DeepSeek-V4 等发布当天支持)。
Q4:能跑在 TPU 上吗?
A:能。2025-10 起 SGLang-Jax 后端原生支持 TPU;2026-07 RadixArk 与 Google 合作把完整 SGLang 特性带到 TPU(官方博客)。
Q5:最小需要什么硬件?
A:没有硬性下限,但设计目标是数据中心 GPU;消费级卡跑 7B 级小模型可行,生产服务建议 A100/H100/Blackwell 级别。
进阶学习建议
- 精读 RadixAttention 相关论文与实现(仓库 docs/博客),理解”前缀缓存命中”背后的树形 KV 管理,这是它与朴素 batching 的本质差异
- 跑通一次 PD 分离部署(官方 GB200 系列博客给了完整拓扑),理解 prefill 与 decode 的资源画像为何不同
- 对比本站已收录的 vLLM(PagedAttention)与 SGLang(RadixAttention)的缓存设计取舍,形成自己的选型判断
- 用真实 Agent 流量(长系统提示 + 多轮)测一次前缀缓存命中率,量化”缓存友好型 prompt 设计”的收益
- 跟进每周开发者会议(meet.sglang.io)与 roadmap.sglang.io,day-0 支持策略下的版本节奏非常快
参考链接
本文基于公开资料于 2026-08-21 整理,社区指标来自 GitHub API 公开数据,性能数字均为官方博客宣称口径。独立实测未进行,吞吐与延迟以你的硬件与 workload 实测为准。
📊 评分与标签
评分说明
总分 8.6/10 · P_优选
📊 可观测社区指标(采集日期:2026-08-21)
- GitHub: sgl-project/sglang ★32,208, 🔱8,074
- 协议:Apache-2.0
- 活跃度:最近推送 2026-08-21(采集当日),贡献者 453+,LMSYS 系社区(Slack + 每周开发者会议)
⚙️ 功能完整度 2.3/2.5
- 完整推理服务栈:OpenAI 兼容 API、RadixAttention 前缀缓存、投机解码(DFlash/Spec V2)、PD 分离、结构化输出、TPU 后端与 SGLang Diffusion 扩展
- 最新开源模型 day-0 支持(Kimi K3 / DeepSeek-V4 / GLM5.2 / Nemotron 3 等,官方博客 News 区逐条记录)
- 来源:LMSYS 博客
- 竞品对比 1(vLLM):功能面互有攻守,SGLang 的 day-0 节奏与前缀缓存设计是差异化项
- 竞品对比 2(TensorRT-LLM):SGLang 开箱即用程度与模型覆盖广度更好,极致单卡优化深度略逊
✨ 输出质量 2.3/2.5
- 官方宣称 GB300 NVL72 上 25x 推理性能(2026-02 博客)、GLM5.2 NVFP4 agentic 负载 500 TPS(2026-07 博客),均为大集群特定 workload 口径
- 来源:GB300 博客
- RadixAttention 对长前缀复用场景(Agent/模板化 prompt)的加速有明确机制解释,非纯营销话术
- 竞品对比 1(vLLM):公开基准互有胜负,两者都比朴素 HuggingFace serving 高一个量级
- 竞品对比 2(HF Transformers 直接部署):吞吐差距通常在数倍到数十倍
🖐️ 易用性 1.0/1.5
- 一条命令起服务 + OpenAI 兼容 API,上手路径清晰;但推理调优(显存预算/并发/KV 策略)需要 GPU 工程经验,门槛客观存在
- 来源:官方文档
- 竞品对比 1(Ollama 等本地工具):易用性差距明显,目标用户不同
- 竞品对比 2(vLLM):上手难度相当,文档与社区互助资源 vLLM 略多(生态更早)
💰 性价比 1.4/1.5
- Apache-2.0 完全免费;对 GPU 密集场景,吞吐提升直接折算成卡数节省,ROI 随规模放大
- 来源:GitHub 仓库
- 竞品对比 1(TensorRT-LLM):省去大量手工算子调优人力
- 竞品对比 2(闭源 API):自部署边际成本可控,隐私与可控性占优
🔒 稳定性 1.0/1.0
- 2026-08-21 活跃推送(采集当日),453+ 贡献者,周度开发者会议与公开 roadmap,迭代节奏健康
- 来源:GitHub API
- 竞品对比 1(vLLM):同级别活跃度
- 竞品对比 2(小众推理框架):社区保障高一个档位
🛡️ 隐私安全 0.6/1.0
- 全栈自部署,模型与数据不出自有基础设施;Apache-2.0 无商业限制
- 生产服务加固(鉴权/限流/TLS)需自行在网关层完成,框架自身安全面文档较少 ⚠️
- 来源:官方文档
- 竞品对比 1(闭源 API):数据出域,SGLang 隐私面占优
- 竞品对比 2(vLLM):同属自部署,安全责任边界相同
标签说明
- AI开发平台: 高性能推理服务框架,属 AI 基础设施层。来源:README
- 开源免费: Apache-2.0 协议,可自由商用。来源:GitHub 仓库
- LLM推理: 核心定位是大模型/多模态模型推理服务。来源:README
- 高性能: RadixAttention、投机解码、PD 分离等性能技术栈。来源:LMSYS 博客
- 模型部署: checkpoint 到 OpenAI 兼容线上服务的完整部署路径。来源:官方文档
来源核实
- ✅ GitHub API 已验证: sgl-project/sglang - Stars 32,208, Forks 8,074, pushed 2026-08-21, Apache-2.0
- ✅ README 已读取: News 区 day-0 支持记录(Kimi K3/DeepSeek-V4/GLM5.2)、TPU 合作、SGLang Diffusion 均核对
- ✅ 官网可访问: sglang.io 与 docs.sglang.io 2026-08-21 实测 HTTP 200
- ⚠️ 未实测: 未实际部署与压测;25x/500 TPS 等性能数字引用官方博客口径,自建环境需自行复现
- ⚠️ 硬件门槛: 设计目标为数据中心 GPU,消费级卡体验未验证
评分依据可追溯至公开数据源,评估日期:2026-08-21。社区指标来自 GitHub API 实时数据;性能数字为官方博客宣称,未独立复测。
同分类推荐
AI开发平台 分类下的其他工具