]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
Move to backend sampling for MTP draft path (#23287)
authorGaurav Garg <redacted>
Wed, 20 May 2026 17:04:45 +0000 (22:34 +0530)
committerGitHub <redacted>
Wed, 20 May 2026 17:04:45 +0000 (22:34 +0530)
commitad277572619fcfb6ddd38f4c6437283a4b2b8636
tree53eb5a922c69468c1c037d5d1a174464ee90b773
parent3a6db741a8189a45260536581f4ebb0a7f051f3c
Move to backend sampling for MTP draft path (#23287)

* Move to backend sampling for MTP draft path

Run top_k(10) on the draft backend. D2H transfers happen only for the top 10 logits

Make backend sampling more robust and fallback to CPU on failure cases, such as with "-sm tensor" or when a backend doesn't support TOP_K.

* Allow sampler chains to be partially offloaded to backend

* Add --spec-draft-backend-sampling argument. Enabled by default.
common/arg.cpp
common/common.h
common/speculative.cpp
src/llama-context.cpp