]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commitdiff
ggml-cpu/ops: vectorize flash-attention V-cache F16 to F32 conversion (#26947)
authorjinzihao <redacted>
Thu, 13 Aug 2026 09:04:46 +0000 (17:04 +0800)
committerGitHub <redacted>
Thu, 13 Aug 2026 09:04:46 +0000 (12:04 +0300)
Co-authored-by: jinzihao <redacted>
ggml/src/ggml-cpu/ops.cpp

index 42ec809ce521620f62c02619bdf47f5350cd2a13..25bb7438389dd646a2f202d9273aba1a98610376 100644 (file)
@@ -8941,7 +8941,7 @@ static void ggml_compute_forward_flash_attn_ext_tiled(
             for (int tk = 0; tk < kv_tile; tk++) {
                 const char * v_data = (const char *)v->data + (ic + tk)*nbv1 + iv2*nbv2 + iv3*nbv3;
                 if (kv_type == GGML_TYPE_F16) {
-                    ggml_fp16_to_fp32_row((const ggml_fp16_t *)v_data, V32 + tk * DV, DV);
+                    ggml_cpu_fp16_to_fp32((const ggml_fp16_t *)v_data, V32 + tk * DV, DV);
                 } else {
                     memcpy(V32 + tk * DV, v_data, DV * sizeof(float));
                 }