NANO-VLLM LAB
Scheduler 与连续批处理
添加不同长度的请求,改变 token 预算,观察 Prefill、Chunked Prefill 和 Decode 的选择。
概念模拟,不执行真实模型
队列与本轮批次
Waiting
0
Running
0
本轮 tokens
0
添加请求开始模拟。