Skip to content

术语表

术语本教程中的含义
Autoregressive每次基于已有上下文生成下一个 token
Batch一次 GPU 执行中共同处理的一组序列或 token
Continuous Batching请求完成后立即补入新请求,而非等待整批结束
Prefill处理 prompt 中尚未缓存的多个 token,建立 KV Cache
Decode每轮为每个活跃序列生成一个新 token
KV Cache保存历史 token 在每层 Attention 中的 Key / Value
BlockKV Cache 的固定大小物理分配单元
Block TableSequence 的逻辑 block 到物理 block id 映射
Slot Mapping当前输入 token 到 KV Cache 物理槽位的映射
PagedAttention借鉴虚拟内存分页管理可变长度 KV Cache 的方法
Prefix Cache复用相同完整前缀已经计算出的 KV blocks
TTFTTime To First Token,首 token 延迟
TPOTTime Per Output Token,后续每 token 延迟
Tensor Parallel把单层矩阵计算切分到多张 GPU
NCCLNVIDIA 多 GPU 集合通信库
CUDA Graph捕获固定 GPU 操作图并低开销回放
Eager Mode普通动态 PyTorch 执行,便于调试
Logits模型对词表每个 token 输出的未归一化分数
Temperature调整采样分布尖锐或平坦程度的参数
RoPERotary Position Embedding,旋转位置编码
Triton用 Python 风格 DSL 编写 GPU kernel 的工具

社区教程,与 nano-vLLM 上游项目无官方隶属关系。