]> git.djapps.eu Git - pkg/ggml/sources/whisper.cpp/commit
CUDA: Add Flash Attention Support for Head Dimension 512 (llama/20998)
authorAnav Prasad <redacted>
Wed, 1 Apr 2026 07:07:24 +0000 (07:07 +0000)
committerGeorgi Gerganov <redacted>
Thu, 30 Apr 2026 08:28:58 +0000 (11:28 +0300)
commit933bd1f79c925f9f1d563854dd1fb4e40c288568
tree48341e4b4285eb5abcd46214d78bc020829ec2ee
parent78f54d15d80aded8a603e12fb066539acdb32f49
CUDA: Add Flash Attention Support for Head Dimension 512 (llama/20998)

* flash attention support for head dimension 512 added

* FA D=512 - match 576 configs, limit ncols2, revert vec cap

* fix HIP tile kernel build for D=512

* fix HIP tile kernel occupancy for D=512 on AMD

* Apply suggestions from code review

Co-authored-by: Johannes Gäßler <redacted>
* fix tile FA compilation

---------

Co-authored-by: Johannes Gäßler <redacted>
14 files changed:
ggml/src/ggml-cuda/fattn-mma-f16.cuh
ggml/src/ggml-cuda/fattn-tile.cu
ggml/src/ggml-cuda/fattn-tile.cuh
ggml/src/ggml-cuda/fattn.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_1-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_4.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_4.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_2-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_4.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_4.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_8.cu
ggml/src/ggml-cuda/template-instances/fattn-tile-instance-dkq512-dv512.cu [new file with mode: 0644]
ggml/src/ggml-cuda/template-instances/generate_cu_files.py