文章

LLM 推理服务化知识总览

LLM 推理服务化知识总览

训练系列讲「模型怎么造出来」,本系列讲「模型怎么跑成服务」。从单卡 ollama run 到千级 QPS 的生产集群,核心矛盾是:Decoder-only 自回归生成的串行本质 vs 用户对低延迟/高吞吐的期望。本系列把推理引擎、KV Cache、量化、调度、部署、调优串成一条可落地的链路。


一、本系列的定位(与训练系列互补)

| 维度 | LLM 训练系列 | LLM 推理服务化系列(本系列) | |------|--------------------------------|--------------------------------| | 关注点 | 怎么把参数训出来 | 怎么把训好的参数高效跑成服务 | | 显存大头 | 优化器状态(72%) + 激活值 | 模型权重 + KV Cache(随请求动态增长) | | 计算模式 | 前向+反向,可大规模并行 | 自回归逐 token,强串行 | | 核心优化 | 并行策略/混合精度/显存 | 吞吐/延迟/成本 三角权衡 | | 关键指标 | 收敛、loss、MFU | TTFT、TPOT、throughput、tokens/watt |

训练系列里「显存计算详解」已铺垫:推理显存 ≈ 参数大小,量化后更小。本系列在此基础上展开”动态部分”——KV Cache 与并发请求如何吃光显存。


二、知识结构图

graph TD
    A[LLM 推理服务化] --> B[推理引擎选型]
    A --> C[KV Cache 与显存]
    A --> D[量化部署]
    A --> E[高并发调度]
    A --> F[生产部署运维]
    A --> G[性能基准与调优]

    B --> B1[vLLM / SGLang / TRT-LLM / LMDeploy / Ollama]
    C --> C1[PagedAttention 分页管理]
    C --> C2[KV 量化 / Prefix Cache]
    D --> D1[AWQ / GPTQ / GGUF / FP8]
    E --> E1[Continuous Batching]
    E --> E2[Prefill-Decode 分离 / 投机解码]
    F --> F1[K8s 部署 / 监控 / 扩缩容]
    G --> G1[TTFT / TPOT / 瓶颈定位]

三、学习路线(建议顺序)

1. 推理引擎对比与选型   → 先知道有哪些"发动机",各自适合什么场景
2. KV Cache 与 PagedAttention → 理解推理显存为什么"动态暴涨"
3. 推理量化部署         → 如何把 70B 塞进一张卡、或让 7B 跑在笔记本
4. 高并发调度与吞吐优化 → 如何让单机 QPS 翻几倍(batching / 分离 / 投机)
5. 生产部署与运维       → Docker/K8s、API 网关、监控告警、成本
6. 性能基准与调优       → 怎么测、怎么定位瓶颈、怎么调参数

四、核心概念速查

概念一句话
TTFT (Time To First Token)从发请求到出第一个 token 的延迟,受 prefill 影响大
TPOT (Time Per Output Token)相邻输出 token 的间隔,受 decode 算力与 KV Cache 带宽影响
Throughput系统总 token/s(所有请求合计),衡量成本效率
KV Cache缓存历史 token 的 K/V 矩阵,避免重复计算,但随 seq 线性增长
PagedAttention把 KV Cache 像虚拟内存一样分页,消除碎片,提升并发
Continuous Batching不等整批跑完,token 级动态进出,GPU 利用率拉满
Prefill / Decode预填充(算 prompt 的 KV,算力密集)vs 解码(逐 token,访存密集)——两阶段异构
Speculative Decoding小模型草稿 + 大模型验证,并行”猜”多个 token
AWQ / GPTQ训练后量化(PTQ)主流方案,4-bit 几乎无损
GGUFllama.cpp 的量化格式,CPU/Apple Silicon 友好
Tensor Parallel权重切片跨多卡,单请求低延迟的关键
OpenAI-compatible APIvLLM/SGLang 都兼容 /v1/chat/completions,换引擎零改代码

五、目录树

07-Knowledge/llm-serving/
├── LLM 推理服务化知识总览.md      ← 本篇(MOC)
├── LLM 推理引擎对比与选型.md
├── KV Cache 原理与 PagedAttention.md
├── LLM 推理量化部署.md
├── 高并发调度与吞吐优化.md
├── 生产部署与运维.md
└── 推理性能基准测试与调优.md

六、工具链总览

类别代表工具
高性能推理引擎vLLM、SGLang、TensorRT-LLM、LMDeploy
轻量/本地Ollama、llama.cpp、MLC-LLM
分布式编排Ray Serve、Triton Inference Server
模型格式/量化GGUF、Safetensors、AutoGPTQ、AutoAWQ、llm-compressor
网关/路由LiteLLM、APISIX、Higress(OpenAI 兼容统一入口)
监控Prometheus + Grafana、vLLM /metrics、DCGM-exporter
压测vLLM benchmark_serving.py、Genai-Perf、LLMPerf

七、关联知识


参考资源

学习时间

阶段时间备注
内容创建2026-07-20服务化系列总览,与训练系列互补,定位 MOC

状态标记

📖 已掌握 — 系列定位、核心指标(TTFT/TPOT)、工具链图谱 📝 待补充 — 各引擎实测数据、具体模型的量化 recipe、GPU 共享调度(MIG/MPS)