NANO-VLLM LAB

Benchmark 与优化假设

输入 token 数与时间,计算吞吐;再改变批次、缓存命中等假设,训练“先测量再优化”的习惯。

概念模拟,不执行真实模型

结果

吞吐0
概念 Prefill 节省0
单序列公平性风险

实验记录模板

硬件: 模型: 配置:block size / max batched tokens / eager: 输入分布: 输出分布: Warmup: 测量次数: 结果:吞吐 / TTFT / TPOT: 结论与下一步: