Skip to content

性能基准

状态:基准测试体系尚未建立。本页面描述将要使用的方法,不包含任何实测数字。 实测结果产出后(见 ROADMAP 第 2 阶段),会以可复现脚本 + 数据快照的形式补充到这里。

计划采用的方法

测量纪律

  • 固定硬件、驱动版本、CUDA Toolkit 版本、输入形状,并全部记录在结果表中
  • 预热迭代与正式采样分离;正式采样取中位数并记录迭代次数
  • kernel-only 计时用 CUDA Event;端到端计时用宿主侧单调时钟
  • 性能测试与正确性测试分离:前者允许 warmup 与统计,后者必须快速失败

计划覆盖的指标

指标定义工具
TTFT首 token 延迟(prefill 阶段)宿主计时
TPOTdecode 阶段每 token 平均延迟宿主计时
Decode 吞吐稳态 token 生成速率(tok/s)宿主计时
峰值显存权重 + KV Cache + 激活cudaMemGetInfo 差值
数值质量量化前后困惑度变化评估脚本(待实现)

计划的对比基线

  • llama.cpp:相同 GGUF 文件、相同量化、相同硬件
  • FP16 参考路径:本仓库自身的未量化路径(衡量 W8A16 的代价与收益)

不会做的事

  • 不引用无法用仓库内脚本复现的数字
  • 不与无法对齐输入和统计口径的第三方数字直接对比

基于 MIT 许可证发布