]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
ggml-webgpu: improve MTP inference by using mat-vec path for small batches (#24811)
authorMasashi Yoshimura <redacted>
Tue, 23 Jun 2026 08:13:55 +0000 (17:13 +0900)
committerGitHub <redacted>
Tue, 23 Jun 2026 08:13:55 +0000 (17:13 +0900)
commit7c908502ea0868e6ae913f79ba84ba844a5b386a
treeaa8abcb5af60bf2a6c66e0b517709f98cd2ac152
parent035cd8f9a6dda9cd0224b07d3df2dc95f7a3a31e
ggml-webgpu: improve MTP inference by using mat-vec path for small batches (#24811)

* ggml-webgpu: improve small batches decoding

* Add barrier to the NUM_COLS loop in mul-mat-vec
ggml/src/ggml-webgpu/ggml-webgpu-shader-lib.hpp
ggml/src/ggml-webgpu/ggml-webgpu.cpp
ggml/src/ggml-webgpu/wgsl-shaders/mul_mat_id_vec.wgsl
ggml/src/ggml-webgpu/wgsl-shaders/mul_mat_vec.wgsl
ggml/src/ggml-webgpu/wgsl-shaders/mul_mat_vec_acc.tmpl
ggml/src/ggml-webgpu/wgsl-shaders/mul_mat_vec_q_acc.tmpl
ggml/src/ggml-webgpu/wgsl-shaders/quantize_q8.wgsl
tests/test-backend-ops.cpp