NANO-VLLM · SCHEDULER LAB

把调度变成一次可解释的选择

你先预测 token 预算会怎样分配,再运行概念模拟,并用队列、预算、阶段与状态迁移解释差异。

概念模拟,不执行真实模型
1设定场景
创建请求与预算
2写下预测
先承诺你的判断
3解释差异
把结果连回原理

本轮工作台

Waiting0
Running0
本轮 tokens0
本轮 token 预算32 可用 · 尚未调度
Decode完整 PrefillChunked Prefill剩余预算

WAITING

RUNNING

先装载对比任务,或加入自己的请求。然后在运行前写下预测。
还没有调度。 Scheduler 每轮不是挑“固定的一批人”,而是在可用预算内重新选择这一轮要完成的 token 工作。