]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
CUDA: tighter MMQ src1 buffer size for native fp4 (#25613)
authorleonardHONG <redacted>
Wed, 15 Jul 2026 15:21:22 +0000 (23:21 +0800)
committerGitHub <redacted>
Wed, 15 Jul 2026 15:21:22 +0000 (23:21 +0800)
commitf6f12e43fa869ef0e008b99ed97dc4006bbb8907
treee93a7f26af2b77ff968e019ba835a136bf453323
parent956973c76466b6c791d7bdbe6eed3aa3235b2dc1
CUDA: tighter MMQ src1 buffer size for native fp4 (#25613)
ggml/src/ggml-cuda/mmq.cu
ggml/src/ggml-cuda/mmq.cuh
ggml/src/ggml-cuda/quantize.cu