🧭
小白也能进入
每章先回答“为什么”,再看最小代码与上游文件,不要求一开始就懂 CUDA。
很多 nano-vLLM 解读会直接从 scheduler.py 或 block_manager.py 开始,但初学者缺少三个关键心智模型:请求如何流动、KV Cache 为什么要分页、Prefill 与 Decode 为什么要分开优化。本书将这些机制变成可操作的网页实验,再把每个交互映射回真实源码。
IMPORTANT
本教程是社区学习项目,不是 GeeeekExplorer/nano-vllm 的官方文档。上游项目持续变化,请以源码主分支为最终依据。