]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
Add flash attention MMA / Tiles to support MiMo-V2.5 (#22812)
authorAesSedai <redacted>
Sat, 9 May 2026 03:28:29 +0000 (20:28 -0700)
committerGitHub <redacted>
Sat, 9 May 2026 03:28:29 +0000 (11:28 +0800)
commit046e2844370208007c116fab448ed4033d77653f
treec650ff56c0d03f385ca646db6981d3c2cf447683
parent66001722aa0c79ef12505488eb2d15400c3e8569
Add flash attention MMA / Tiles to support MiMo-V2.5 (#22812)

* mimo-v2.5: add flash attention mma/tiles for for d_kq=192 d_v=128

* mimo-v2.5: follow (256, 256) fattn templates

* mimo-v2.5: cleanup comments

* mimo-v2.5: further comment cleanup

* mimo-v2.5: address PR feedback
fix GQA handling
check for other dangling 320/576 carveouts and mirror them for 192
Add to backend ops test so new paths are covered
14 files changed:
ggml/src/ggml-cuda/fattn-mma-f16.cuh
ggml/src/ggml-cuda/fattn-tile.cu
ggml/src/ggml-cuda/fattn-tile.cuh
ggml/src/ggml-cuda/fattn.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_16.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_16.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_16.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq192-dv128.cu [new file with mode: 0644]
ggml/src/ggml-cuda/template-instances/generate_cu_files.py
tests/test-backend-ops.cpp