]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
vulkan: add FA dequant for q4_1, q5_0, q5_1, iq4_nl (#21029)
authormkoker <redacted>
Tue, 7 Apr 2026 11:41:29 +0000 (07:41 -0400)
committerGitHub <redacted>
Tue, 7 Apr 2026 11:41:29 +0000 (13:41 +0200)
commitedd4d9bca5dcb9be1ce66e618157d8787a0ea16f
treeab6bde901b40d1223f9a8ce36279ed0ab4519278
parent482192f12dbb79e710505bb454599caa5f4354ec
vulkan: add FA dequant for q4_1, q5_0, q5_1, iq4_nl (#21029)

Add dequantize4() implementations for Q4_1, Q5_0, Q5_1, and IQ4_NL
in the flash attention base shader. Register them in the shader
generator, pipeline creation, and enable in the scalar/coopmat1 FA
support check.
ggml/src/ggml-vulkan/ggml-vulkan.cpp
ggml/src/ggml-vulkan/vulkan-shaders/flash_attn_base.glsl
ggml/src/ggml-vulkan/vulkan-shaders/vulkan-shaders-gen.cpp