资料来源与版本说明
主要来源
- GeeeekExplorer/nano-vllm — 教程的主要源码对象,MIT License。
- nano-vLLM README — 功能、安装、示例与 benchmark。
- PagedAttention 论文 — 分页 KV Cache 与 vLLM 的原始系统论文。
- Hugging Face Hub CLI — 当前
hf download用法。 - VitePress Deployment — GitHub Pages 部署方式。
- GitHub Pages custom workflows — Pages artifact 与 deploy action。
- PyTorch CUDA semantics / CUDAGraph — CUDA Graph API 概念。
调研快照
- 教程建立日期:2026-08-02。
- 上游仓库当日公开页面显示约 1,200 行 Python 核心实现,并包含 Prefix caching、Tensor Parallelism、Torch compilation 与 CUDA graph。
- 教程不复制完整上游源码,只引用小片段、文件名与教学性伪代码。
- 上游主分支、依赖和 API 可能变化;遇到冲突时以上游当前代码为准。
非官方声明
本仓库是独立社区教程,与 nano-vLLM 作者或维护者没有官方隶属关系。nano-vLLM 名称仅用于指明学习对象。