NANO-VLLM · SEQUENCE LAB

把一条请求拆成四个不同的时间点

你将亲眼区分状态、调度计划、真实执行和缓存提交:它们相关,但不会在同一刻发生。

概念模拟,不执行真实模型
1设定请求
装载 token 档案
2写下预测
先判断字段变化
3解释时序
用状态、计划、执行、提交

Sequence #42 的字段时间线

总 token0
Prompt token0
Completion token0
WAITING
RUNNING
FINISHED
token 档案与本轮进度尚未创建
已提交 KV Cache本轮已计划,未提交新 completion token未处理
num_scheduled_tokens0
num_cached_tokens0
block_table[]
当前阶段
先装载预设请求,再在运行前写下预测。
你的解释锚点:依次问自己:请求处于什么状态?Scheduler 做了什么计划?模型是否已经执行?缓存是否已经提交