NANO-VLLM LAB
分页 KV Cache 分配器
把 KV Cache 想成 GPU 上的固定大小“页”。请求只记录 block table,不要求连续显存。
GPU KV Cache Blocks
已用 blocks0
空闲 blocks40
内部浪费 token 位0
block_table A = []
block_table B = []
block_table B = []
把 KV Cache 想成 GPU 上的固定大小“页”。请求只记录 block table,不要求连续显存。