NANO-VLLM · PREFIX CACHE LAB

先预测可复用几页,再观察哈希链如何让两条请求共享 KV

两条请求的前 8 个 token 相同,block_size=4,而第 9 个 token 已经分叉。请先判断能够复用的完整 block 数,然后观察命中时引用计数为何要增加。

概念模拟,不执行真实模型
1设定任务
读共享前缀与页边界
2承诺预测
选择可复用完整 block
3运行并解释
比对 hash chain 与 ref_count

共享 token 边界与缓存目录

两请求共同 token8
本轮 hash 命中 block0
共享 block 的 ref_count0

Request A · 先到达

logical block 0 · 完整

t0 t1 t2 t3

logical block 1 · 完整

t4 t5 t6 t7

logical block 2 · 未完整

A8 A9 …

Request B · 后到达

logical block 0 · 相同

t0 t1 t2 t3

logical block 1 · 相同

t4 t5 t6 t7

logical block 2 · 已分叉

B8 B9 …

Prefix Cache 的链式哈希目录先由 A 产生两项完整 block 目录
任务已装载。先判断“共同 token 数”与“可复用完整 block 数”是不是同一个概念:第 9 个 token 分叉前,只有完整页才能成为本题的 cache entry。
你的解释锚点:连续匹配到的 token 只有在恰好覆盖完整 block 时才能在此抽象中复用;后继 block 的 hash 还依赖前一个 block 的 hash,因此前缀顺序也被编码进了查找键。