NANO-VLLM · KV CACHE LAB

先预测一个请求需要几页,再观察它如何离散分配

你将把 11 个 token 映射到固定大小 block,观察最后一页的内部碎片;随后让一个刚好填满页的请求追加 token,区分检查空闲页和真正修改 block_table 的两个时刻。

概念模拟,不执行真实模型
1设定任务
选择 block size 与请求长度
2承诺预测
先判断页数、空位与边界
3运行并解释
读 table、queue 与追加结果

逻辑页与离散物理 block

当前 block size4
已用 / 空闲 blocks0 / 16
本轮结果等待预测

Sequence A · 11 token 的逻辑页

尚未分配。先用 ceil(长度 / block size) 写下预测。

Sequence B · 追加边界

尚未分配。B 会先恰好填满一个 block,再追加 1 token。
GPU KV Cache 的物理 block空闲页队列可提供离散 id
Sequence A 占用Sequence B 占用空闲物理 block
free_block_ids = [7, 2, 14, 0, 9, …]
先装载对比任务。重要:不要直接点击“分配请求 A”;先选择三项预测,然后再用状态变化检验推理。
你的解释锚点:页数由 ceil(token 数 / block size) 决定;最后一页未用 token 位是内部碎片;物理 id 是否相邻不决定逻辑访问顺序。