性能基准
状态:基准测试体系尚未建立。本页面描述将要使用的方法,不包含任何实测数字。 实测结果产出后(见 ROADMAP 第 2 阶段),会以可复现脚本 + 数据快照的形式补充到这里。
计划采用的方法
测量纪律
- 固定硬件、驱动版本、CUDA Toolkit 版本、输入形状,并全部记录在结果表中
- 预热迭代与正式采样分离;正式采样取中位数并记录迭代次数
- kernel-only 计时用 CUDA Event;端到端计时用宿主侧单调时钟
- 性能测试与正确性测试分离:前者允许 warmup 与统计,后者必须快速失败
计划覆盖的指标
| 指标 | 定义 | 工具 |
|---|---|---|
| TTFT | 首 token 延迟(prefill 阶段) | 宿主计时 |
| TPOT | decode 阶段每 token 平均延迟 | 宿主计时 |
| Decode 吞吐 | 稳态 token 生成速率(tok/s) | 宿主计时 |
| 峰值显存 | 权重 + KV Cache + 激活 | cudaMemGetInfo 差值 |
| 数值质量 | 量化前后困惑度变化 | 评估脚本(待实现) |
计划的对比基线
- llama.cpp:相同 GGUF 文件、相同量化、相同硬件
- FP16 参考路径:本仓库自身的未量化路径(衡量 W8A16 的代价与收益)
不会做的事
- 不引用无法用仓库内脚本复现的数字
- 不与无法对齐输入和统计口径的第三方数字直接对比