Skip to content

附录 C:术语表 ​

只收录正文使用的术语。同一概念全系列只用一个译名,首次出现附英文原名。

术语英文释义
引擎核心EngineCore独立进程中的调度大脑,持有 Scheduler 与 KV 账本(vllm/v1/engine/core.py)
调度器Scheduler每个 engine step 决定调度哪些请求、各推进多少 token 的组件
步step调度器的一次"调度 + 执行 + 收账"循环,一次前向
连续批处理continuous batching请求随到随进、随完随走的批次组织方式,无需等待整批结束
分页注意力PagedAttention把 KV Cache 按固定大小块管理、支持非连续显存的注意力实现
块blockKV Cache 的分配单位,固定 token 数(默认 16),是第 7 章的核心概念
块池BlockPool空闲块队列 + hash 索引 + 引用计数,物理 KV 块的所有者
块表block table每请求的块号序列,调度器账本在 GPU 侧的镜像
前缀缓存prefix caching内容寻址(BlockHash)复用相同前缀 KV 的机制
命中cache hit请求前缀与已缓存块哈希匹配,可跳过计算
token 预算token budget单步全局可调度的 token 上限(max_num_scheduled_tokens)
分块预填充chunked prefill超预算的 prompt 被切成多步逐步送入模型
抢占preemption显存不足时把运行中请求踢出、释放块、重入等待队列(重算式)
计算令牌数num_computed_tokens请求已完成计算(含缓存命中)的 token 计数器,调度的统一视角
采样参数sampling params温度、top-k/top-p、惩罚、stop 条件等生成控制参数
logits 处理器logits processor在采样前修改 logits 分布的插件(含结构化输出约束)
位掩码grammar bitmask结构化输出每步生成的词表掩码,非法 token 概率归零
增量反词元化incremental detokenization只解码新 token、维护 UTF-8 残片的文本重建方式
流式收集器RequestOutputCollector每请求一个的覆盖式输出队列,实现流式背压
持久批次persistent batch常驻 Worker 的批次元数据,每步只做增量增删
注意力元数据attention metadataattention kernel 所需的块表、序列长度等输入布局
CUDA 图CUDA Graph把整次前向录制成图并按形状 replay 的延迟优化
执行器ExecutorEngineCore 与 Worker 进程模型之间的可替换件(uni/mp/ray)
通信组process grouptorch.distributed 意义上的进程集合(TP/PP/DP 组)
张量并行TP,tensor parallel按层内权重矩阵切分到多卡
流水线并行PP,pipeline parallel按层深度切分,中间张量在 rank 间传递
数据并行DP,data parallel复制多套引擎,各自调度、按负载路由请求
专家并行EP,expert parallelMoE 专家分布到不同卡
提案者proposer投机解码中产生草稿 token 的组件(n-gram / Eagle / Medusa / MTP)
拒绝采样rejection sampling投机解码的验证算法,保证输出分布与自回归采样一致
KV 连接器KV Connector跨引擎/跨层缓存搬运 KV 的扩展协议(P/D 分离、LMCache 等)
分离式部署P/D disaggregationPrefill 与 Decode 引擎实例分离、经 Connector 传递 KV 的架构
平台Platform硬件抽象(CUDA/ROCm/TPU/XPU/CPU),声明设备能力
插件plugin经 entry points 在启动期注册模型/平台/端点的外部代码
结构化输出structured output用 JSON Schema/正则/文法约束生成内容的机制
量化配置quantization config每种量化方案(fp8/AWQ/…)提供替换层的配置类
加载器model loader按 load_format 分派的权重装载组件
块事件KV cache events块存储/移除的对外事件流,供外部网关感知缓存状态
最近更新