NANO-VLLM LAB

一次 generate() 发生了什么

输入一句话,逐步观察它从文本进入 tokenizer、请求队列、模型执行与采样器。

概念模拟,不执行真实模型

请求流水线

PromptTokenizerSchedulerModelRunnerSampler
点击“下一步”开始。