]> git.djapps.eu Git - pkg/ggml/sources/whisper.cpp/commit
vulkan: add Flash Attention support for BFloat16 KV cache (llama/23420)
authorRuben Ortlam <redacted>
Sat, 30 May 2026 08:39:31 +0000 (10:39 +0200)
committerGeorgi Gerganov <redacted>
Mon, 8 Jun 2026 11:36:36 +0000 (14:36 +0300)
commit4317ddbe2b0fa7f436593658c8252469e598b36a
tree9985f6f5ad63367de9704bde208eccbcc36dca00
parent9147a9676b9945920088e90ee703d2ff462ded8b
vulkan: add Flash Attention support for BFloat16 KV cache (llama/23420)

* vulkan: add flash attention bf16 kv support

* vulkan: bf16 FA coopmat1 support

* vulkan: bf16 FA coopmat2 support

* fix FA bf16 f32 fallback

* fix FA bf16 coopmat1 shader

* fix FA bf16 coopmat2 shader

* code cleanup

* cleanup comment change

* address feedback

* add O_TYPE for cm2 FA

* use O_TYPE for gqaStore function

* reduce BFLOAT16 ifdefs
ggml/src/ggml-vulkan/ggml-vulkan.cpp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.glsl
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm2.comp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_dequant.glsl
ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp