]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commitdiff
vulkan: Apply bias before softmax in FA, to avoid overflow (#24909)
authorJeff Bolz <redacted>
Wed, 24 Jun 2026 03:34:00 +0000 (22:34 -0500)
committerGitHub <redacted>
Wed, 24 Jun 2026 03:34:00 +0000 (22:34 -0500)
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn.comp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_cm1.comp

index 91fb07c93e7e761b73263cb3dec1e6c5c8d722a6..3192130ccf57ae1f3c9a7954f94763f00066d22b 100644 (file)
@@ -463,6 +463,7 @@ void main() {
                 }
                 rowmaxf = max(rowmaxf, float(Sf[r][c]));
             }
+            rowmaxf += FATTN_KQ_MAX_OFFSET;
             float Moldf = Mf[r];
 
             // M = max(rowmax, Mold)
index 23ae3833e52255ac0e81099ba1159c9f7fb53e30..16178e57702420042f90f6d177ca7c3985fd799e 100644 (file)
@@ -352,6 +352,7 @@ void main() {
                 }
                 rowmaxf = max(rowmaxf, float(sfsh[r_vec + (c * cols_per_iter + col_tid) * sfshstride][r_comp]));
             }
+            rowmaxf += FATTN_KQ_MAX_OFFSET;
             float Moldf = Mf[r];
 
             // Compute max across the row