]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
CUDA: fix Gemma E4B MTP FlashAttention (#25148)
authorJohannes Gäßler <redacted>
Tue, 30 Jun 2026 12:06:54 +0000 (14:06 +0200)
committerGitHub <redacted>
Tue, 30 Jun 2026 12:06:54 +0000 (14:06 +0200)
commite495d1e748b4b683559b4beb82b367825ab781a4
tree2a32c74fc59fb4c9dcf811e913ff4d18bfc757b9
parentf708a5b2caaee0226c0af220e366785699ba41e2
CUDA: fix Gemma E4B MTP FlashAttention (#25148)

* CUDA: fix Gemma E4B MTP FlashAttention

* remove unused template declaration
ggml/src/ggml-cuda/fattn-mma-f16.cuh
ggml/src/ggml-cuda/fattn-tile.cuh
ggml/src/ggml-cuda/fattn.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/generate_cu_files.py