| model                          |       size |     params | backend    | ngl | type_k | type_v |  fa |            test |                  t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | -----: | -----: | --: | --------------: | -------------------: |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |           pp512 |     9080.04 ± 317.07 |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |          pp4096 |      8511.68 ± 41.61 |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |           tg128 |        274.43 ± 2.15 |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |  pp512 @ d16384 |      7763.73 ± 51.05 |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 | pp4096 @ d16384 |      7009.73 ± 15.96 |
| gpt-oss 120B MXFP4 MoE         |  59.02 GiB |   116.83 B | CUDA       | 999 |   q8_0 |   q8_0 |   1 |  tg128 @ d16384 |        231.15 ± 0.17 |

build: d2462f8f7 (9590)
