]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
vulkan: add Flash Attention support for BFloat16 KV cache (#23420)
authorRuben Ortlam <redacted>
Sat, 30 May 2026 08:39:31 +0000 (10:39 +0200)
committerGitHub <redacted>
Sat, 30 May 2026 08:39:31 +0000 (10:39 +0200)
commit6e093b80eae32b1fec18848fe53320b220de1451
treed5df46cf596fb7ad3b56d5fb769c6d31a72cc5ab
parent337528571d99e414ca04fddd86d448960137770f
vulkan: add Flash Attention support for BFloat16 KV cache (#23420)

* vulkan: add flash attention bf16 kv support

* vulkan: bf16 FA coopmat1 support

* vulkan: bf16 FA coopmat2 support

* fix FA bf16 f32 fallback

* fix FA bf16 coopmat1 shader

* fix FA bf16 coopmat2 shader

* code cleanup

* cleanup comment change

* address feedback

* add O_TYPE for cm2 FA

* use O_TYPE for gqaStore function

* reduce BFLOAT16 ifdefs
ggml/src/ggml-vulkan/ggml-vulkan.cpp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.glsl
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_dequant.glsl
ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp