推理 / 服务
训练一次,服务一生。推理系统的 KPI 是延迟、吞吐、成本三角,而所有优化都围着同一块稀缺资源转:显存带宽。
本章节内容:
- KV Cache——为什么它决定一切,以及 PagedAttention。
- Continuous Batching——iteration 级调度,吞吐的革命。
- 请求调度——SLO 之下的排队与抢占。
- Chunked Prefill——把长提示切块,填平预填充与解码的鸿沟。
- Prefix Caching——相同前缀只算一次。
- 投机采样——小模型起草、大模型验卷。
- P/D 分离——预填充与解码分开部署。
- A/F 分离——注意力与 FFN 分开部署。
- 推理引擎版图——vLLM、TensorRT-LLM、SGLang、llama.cpp 的取舍与选型。
阅读主线:先理解 KV Cache 这个"显存霸主",再理解调度如何榨干带宽,然后是量化(见量化与稀疏章)、投机、分离式三类系统级手段如何层层加码,最后用引擎版图把机制映射到具体系统。多实例的服务化设计(扩缩容、路由、多租户)见平台与调度章。