NANO-VLLM LAB
一次 generate() 发生了什么
输入一句话,逐步观察它从文本进入 tokenizer、请求队列、模型执行与采样器。
概念模拟,不执行真实模型
请求流水线
Prompt
→
Tokenizer
→
Scheduler
→
ModelRunner
→
Sampler
点击“下一步”开始。