Skip to content

推理 / 服务 ​

训练一次,服务一生。​推理系统的 KPI 是延迟、吞吐、成本三角,而所有优化都围着同一块稀缺资源转:显存带宽。

本章节内容:

  1. KV Cache——为什么它决定一切,以及 PagedAttention。
  2. Continuous Batching——iteration 级调度,吞吐的革命。
  3. 请求调度——SLO 之下的排队与抢占。
  4. Chunked Prefill——把长提示切块,填平预填充与解码的鸿沟。
  5. Prefix Caching——相同前缀只算一次。
  6. 投机采样——小模型起草、大模型验卷。
  7. P/D 分离——预填充与解码分开部署。
  8. A/F 分离——注意力与 FFN 分开部署。
  9. 推理引擎版图——vLLM、TensorRT-LLM、SGLang、llama.cpp 的取舍与选型。

阅读主线:先理解 KV Cache 这个"显存霸主",再理解调度如何榨干带宽,然后是量化(见量化与稀疏章)、投机、分离式三类系统级手段如何层层加码,最后用引擎版图把机制映射到具体系统。多实例的服务化设计(扩缩容、路由、多租户)见平台与调度章。

最近更新