NANO-VLLM LAB

CUDA Graph:捕获一次,重复回放

比较 Eager 模式逐个发起 kernel 与 CUDA Graph 预先捕获固定执行图的差异。

概念模拟,不执行真实模型

CPU 发射与 GPU 工作

概念 CPU launch 次数0
Graph capture0
Graph replay0