NANO-VLLM LAB
CUDA Graph:捕获一次,重复回放
比较 Eager 模式逐个发起 kernel 与 CUDA Graph 预先捕获固定执行图的差异。
概念模拟,不执行真实模型
CPU 发射与 GPU 工作
概念 CPU launch 次数
0
Graph capture
0
Graph replay
0