]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commit
server : fix draft model fit vs load inconsistency (#25056)
authorAlex <redacted>
Tue, 7 Jul 2026 14:20:42 +0000 (10:20 -0400)
committerGitHub <redacted>
Tue, 7 Jul 2026 14:20:42 +0000 (17:20 +0300)
commitf5525f7e7a7e7cbecd386144299493ea40499bd3
treeec0f52152eb4edb1c01eed4dceca0135976a9adc
parent5eca4e3cabad9c92ccbf290d8406fbe7c110a680
server : fix draft model fit vs load inconsistency (#25056)

* fix: draft model fit vs load inconsistency

* refactor(server): unify draft/mtp parameter initialization, model, and context load
- moves speculative init to speculative.cpp
- changes server_context_impl model_dft and ctx_dft to use raw pointers

- fix: don't throttle progress callback when loading draft model
- refactor: rename draft model/ctx load method

* fix: valign
common/speculative.cpp
common/speculative.h
tools/server/server-context.cpp