| model                          |       size |     params | backend    | ngl | type_k | type_v |  fa |            test |                  t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | -----: | -----: | --: | --------------: | -------------------: |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |           pp512 |      4928.20 ± 63.15 |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |          pp4096 |       4702.36 ± 5.84 |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |           tg128 |         61.35 ± 0.03 |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |  pp512 @ d16384 |      4583.91 ± 64.02 |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 | pp4096 @ d16384 |       3733.06 ± 4.00 |
| llama 13B Q8_0                 |  23.33 GiB |    23.57 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |  tg128 @ d16384 |         55.81 ± 0.02 |

build: d2462f8f7 (9590)
