]> git.djapps.eu Git - pkg/ggml/sources/whisper.cpp/commit
CUDA: fix Gemma E4B MTP FlashAttention (llama/25148)
authorJohannes Gäßler <redacted>
Tue, 30 Jun 2026 12:06:54 +0000 (14:06 +0200)
committerGeorgi Gerganov <redacted>
Fri, 10 Jul 2026 10:06:42 +0000 (13:06 +0300)
commit2b35abc294433b1081fe1c7844e97f5417e2cf54
tree2a2cfde0a0cee762cdc45cfbc6cf95daa3399274
parent899c7ed4acefc24bf518ab0a77c36630f70a1737
CUDA: fix Gemma E4B MTP FlashAttention (llama/25148)

* CUDA: fix Gemma E4B MTP FlashAttention

* remove unused template declaration
ggml/src/ggml-cuda/fattn-mma-f16.cuh
ggml/src/ggml-cuda/fattn-tile.cuh
ggml/src/ggml-cuda/fattn.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_16-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_32-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_4-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/fattn-mma-f16-instance-ncols1_8-ncols2_2.cu
ggml/src/ggml-cuda/template-instances/generate_cu_files.py