NANO-VLLM LAB
Benchmark 与优化假设
输入 token 数与时间,计算吞吐;再改变批次、缓存命中等假设,训练“先测量再优化”的习惯。
结果
吞吐0
概念 Prefill 节省0
单序列公平性风险低
实验记录模板
硬件:
模型:
配置:block size / max batched tokens / eager:
输入分布:
输出分布:
Warmup:
测量次数:
结果:吞吐 / TTFT / TPOT:
结论与下一步:
输入 token 数与时间,计算吞吐;再改变批次、缓存命中等假设,训练“先测量再优化”的习惯。