NANO-VLLM LAB
Prefix Cache 命中实验
两个请求共享完整 token block 时,后来的请求可以复用已经计算过的 KV Cache。
概念模拟,不执行真实模型
Token Blocks
A
B
共同 token
0
可复用完整 blocks
0
B 需新算 token
0