NANO-VLLM LAB

分页 KV Cache 分配器

把 KV Cache 想成 GPU 上的固定大小“页”。请求只记录 block table,不要求连续显存。

概念模拟,不执行真实模型

GPU KV Cache Blocks

已用 blocks0
空闲 blocks40
内部浪费 token 位0
block_table A = []
block_table B = []