NANO-VLLM LAB

Prefix Cache 命中实验

两个请求共享完整 token block 时,后来的请求可以复用已经计算过的 KV Cache。

概念模拟,不执行真实模型

Token Blocks

A
B
共同 token0
可复用完整 blocks0
B 需新算 token0