Skip to content

从零读懂 nano-vLLM用互动实验读懂大模型推理引擎

面向开发者与初学者。先通过纯 HTML 场景建立直觉,再回到约 1,200 行 Python 源码,理解调度、分页 KV Cache、Prefix Cache、Attention、Tensor Parallel 与 CUDA Graph。

nano-vLLM 推理引擎抽象架构图
你的学习进度0 / 13
00 学习路线与环境01 第一次推理02 整体架构03 Sequence 状态机04 Scheduler05 分页 KV Cache06 Prefix Cache07 Prefill / Decode08 Attention09 Sampling10 Tensor Parallel11 CUDA Graph12 综合项目

这本教程解决什么问题?

很多 nano-vLLM 解读会直接从 scheduler.pyblock_manager.py 开始,但初学者缺少三个关键心智模型:请求如何流动、KV Cache 为什么要分页、Prefill 与 Decode 为什么要分开优化。本书将这些机制变成可操作的网页实验,再把每个交互映射回真实源码。

IMPORTANT

本教程是社区学习项目,不是 GeeeekExplorer/nano-vllm 的官方文档。上游项目持续变化,请以源码主分支为最终依据。

社区教程,与 nano-vLLM 上游项目无官方隶属关系。