NANO-VLLM · SCHEDULER LAB
把调度变成一次可解释的选择
你先预测 token 预算会怎样分配,再运行概念模拟,并用队列、预算、阶段与状态迁移解释差异。
1设定场景
创建请求与预算
创建请求与预算
2写下预测
先承诺你的判断
先承诺你的判断
3解释差异
把结果连回原理
把结果连回原理
本轮工作台
Waiting0
Running0
本轮 tokens0
本轮 token 预算32 可用 · 尚未调度
Decode完整 PrefillChunked Prefill剩余预算
WAITING
RUNNING
先装载对比任务,或加入自己的请求。然后在运行前写下预测。
还没有调度。 Scheduler 每轮不是挑“固定的一批人”,而是在可用预算内重新选择这一轮要完成的 token 工作。