术语表
| 术语 | 本教程中的含义 |
|---|---|
| Autoregressive | 每次基于已有上下文生成下一个 token |
| Batch | 一次 GPU 执行中共同处理的一组序列或 token |
| Continuous Batching | 请求完成后立即补入新请求,而非等待整批结束 |
| Prefill | 处理 prompt 中尚未缓存的多个 token,建立 KV Cache |
| Decode | 每轮为每个活跃序列生成一个新 token |
| KV Cache | 保存历史 token 在每层 Attention 中的 Key / Value |
| Block | KV Cache 的固定大小物理分配单元 |
| Block Table | Sequence 的逻辑 block 到物理 block id 映射 |
| Slot Mapping | 当前输入 token 到 KV Cache 物理槽位的映射 |
| PagedAttention | 借鉴虚拟内存分页管理可变长度 KV Cache 的方法 |
| Prefix Cache | 复用相同完整前缀已经计算出的 KV blocks |
| TTFT | Time To First Token,首 token 延迟 |
| TPOT | Time Per Output Token,后续每 token 延迟 |
| Tensor Parallel | 把单层矩阵计算切分到多张 GPU |
| NCCL | NVIDIA 多 GPU 集合通信库 |
| CUDA Graph | 捕获固定 GPU 操作图并低开销回放 |
| Eager Mode | 普通动态 PyTorch 执行,便于调试 |
| Logits | 模型对词表每个 token 输出的未归一化分数 |
| Temperature | 调整采样分布尖锐或平坦程度的参数 |
| RoPE | Rotary Position Embedding,旋转位置编码 |
| Triton | 用 Python 风格 DSL 编写 GPU kernel 的工具 |