LLM 推理服务化知识总览
LLM 推理服务化知识总览
训练系列讲「模型怎么造出来」,本系列讲「模型怎么跑成服务」。从单卡
ollama run到千级 QPS 的生产集群,核心矛盾是:Decoder-only 自回归生成的串行本质 vs 用户对低延迟/高吞吐的期望。本系列把推理引擎、KV Cache、量化、调度、部署、调优串成一条可落地的链路。
一、本系列的定位(与训练系列互补)
| 维度 | LLM 训练系列 | LLM 推理服务化系列(本系列) | |------|--------------------------------|--------------------------------| | 关注点 | 怎么把参数训出来 | 怎么把训好的参数高效跑成服务 | | 显存大头 | 优化器状态(72%) + 激活值 | 模型权重 + KV Cache(随请求动态增长) | | 计算模式 | 前向+反向,可大规模并行 | 自回归逐 token,强串行 | | 核心优化 | 并行策略/混合精度/显存 | 吞吐/延迟/成本 三角权衡 | | 关键指标 | 收敛、loss、MFU | TTFT、TPOT、throughput、tokens/watt |
训练系列里「显存计算详解」已铺垫:推理显存 ≈ 参数大小,量化后更小。本系列在此基础上展开”动态部分”——KV Cache 与并发请求如何吃光显存。
二、知识结构图
graph TD
A[LLM 推理服务化] --> B[推理引擎选型]
A --> C[KV Cache 与显存]
A --> D[量化部署]
A --> E[高并发调度]
A --> F[生产部署运维]
A --> G[性能基准与调优]
B --> B1[vLLM / SGLang / TRT-LLM / LMDeploy / Ollama]
C --> C1[PagedAttention 分页管理]
C --> C2[KV 量化 / Prefix Cache]
D --> D1[AWQ / GPTQ / GGUF / FP8]
E --> E1[Continuous Batching]
E --> E2[Prefill-Decode 分离 / 投机解码]
F --> F1[K8s 部署 / 监控 / 扩缩容]
G --> G1[TTFT / TPOT / 瓶颈定位]
三、学习路线(建议顺序)
1. 推理引擎对比与选型 → 先知道有哪些"发动机",各自适合什么场景
2. KV Cache 与 PagedAttention → 理解推理显存为什么"动态暴涨"
3. 推理量化部署 → 如何把 70B 塞进一张卡、或让 7B 跑在笔记本
4. 高并发调度与吞吐优化 → 如何让单机 QPS 翻几倍(batching / 分离 / 投机)
5. 生产部署与运维 → Docker/K8s、API 网关、监控告警、成本
6. 性能基准与调优 → 怎么测、怎么定位瓶颈、怎么调参数
四、核心概念速查
| 概念 | 一句话 |
|---|---|
| TTFT (Time To First Token) | 从发请求到出第一个 token 的延迟,受 prefill 影响大 |
| TPOT (Time Per Output Token) | 相邻输出 token 的间隔,受 decode 算力与 KV Cache 带宽影响 |
| Throughput | 系统总 token/s(所有请求合计),衡量成本效率 |
| KV Cache | 缓存历史 token 的 K/V 矩阵,避免重复计算,但随 seq 线性增长 |
| PagedAttention | 把 KV Cache 像虚拟内存一样分页,消除碎片,提升并发 |
| Continuous Batching | 不等整批跑完,token 级动态进出,GPU 利用率拉满 |
| Prefill / Decode | 预填充(算 prompt 的 KV,算力密集)vs 解码(逐 token,访存密集)——两阶段异构 |
| Speculative Decoding | 小模型草稿 + 大模型验证,并行”猜”多个 token |
| AWQ / GPTQ | 训练后量化(PTQ)主流方案,4-bit 几乎无损 |
| GGUF | llama.cpp 的量化格式,CPU/Apple Silicon 友好 |
| Tensor Parallel | 权重切片跨多卡,单请求低延迟的关键 |
| OpenAI-compatible API | vLLM/SGLang 都兼容 /v1/chat/completions,换引擎零改代码 |
五、目录树
07-Knowledge/llm-serving/
├── LLM 推理服务化知识总览.md ← 本篇(MOC)
├── LLM 推理引擎对比与选型.md
├── KV Cache 原理与 PagedAttention.md
├── LLM 推理量化部署.md
├── 高并发调度与吞吐优化.md
├── 生产部署与运维.md
└── 推理性能基准测试与调优.md
六、工具链总览
| 类别 | 代表工具 |
|---|---|
| 高性能推理引擎 | vLLM、SGLang、TensorRT-LLM、LMDeploy |
| 轻量/本地 | Ollama、llama.cpp、MLC-LLM |
| 分布式编排 | Ray Serve、Triton Inference Server |
| 模型格式/量化 | GGUF、Safetensors、AutoGPTQ、AutoAWQ、llm-compressor |
| 网关/路由 | LiteLLM、APISIX、Higress(OpenAI 兼容统一入口) |
| 监控 | Prometheus + Grafana、vLLM /metrics、DCGM-exporter |
| 压测 | vLLM benchmark_serving.py、Genai-Perf、LLMPerf |
七、关联知识
- ../llm-training/LLM 训练知识总览 — 训练与服务化是同一模型的两端
- ../llm-training/显存计算详解 — 推理显存 ≈ 权重 + KV Cache(本系列展开动态部分)
- ../llm-training/混合精度训练 — FP8/BF16 在推理侧同样关键
- ../llm-training/大模型架构对比 — MoE/MLA/GQA 等架构直接影响推理显存与速度
- ../gpu-cluster-ops/hardware/NVIDIA GPU 架构演进 — 算力/显存带宽决定推理上限
- ../cilium/Cilium 知识总览 — 推理集群的南北向/东西向流量治理
- ../k8s/网络架构/K8s 网络架构总览 — K8s 上跑 vLLM 的网络底座
参考资源
- vLLM Documentation
- SGLang Documentation
- NVIDIA TensorRT-LLM
- PagedAttention 论文 (vLLM)
- AWQ 论文 / GPTQ 论文
学习时间
| 阶段 | 时间 | 备注 |
|---|---|---|
| 内容创建 | 2026-07-20 | 服务化系列总览,与训练系列互补,定位 MOC |
状态标记
📖 已掌握 — 系列定位、核心指标(TTFT/TPOT)、工具链图谱 📝 待补充 — 各引擎实测数据、具体模型的量化 recipe、GPU 共享调度(MIG/MPS)