]> git.djapps.eu Git - pkg/ggml/sources/llama.cpp/commitdiff
server : add extra trace log for prompt similarity (#26218)
authorGeorgi Gerganov <redacted>
Tue, 28 Jul 2026 08:05:16 +0000 (11:05 +0300)
committerGitHub <redacted>
Tue, 28 Jul 2026 08:05:16 +0000 (11:05 +0300)
tools/server/server-task.cpp
tools/server/server-task.h

index 1fd7cce27bb3145c8f8be648c925770e9a6d7ab3..99e63b05f5445f4e4aa04b7a0bfbe0eebdbb81c0 100644 (file)
@@ -1755,6 +1755,8 @@ bool server_prompt_cache::load(server_prompt & prompt, const server_tokens & tok
         const float f_keep_cur = float(lcp_cur) / it->prompt.tokens.size();
         const float sim_cur    = float(lcp_cur) / tokens_new.size();
 
+        SRV_TRC("   - prompt with length %7zu, lcp = %7d, f_keep = %.3f, sim = %.3f\n", it->prompt.tokens.size(), lcp_cur, f_keep_cur, sim_cur);
+
         // don't trash large prompts
         if (f_keep_cur < 0.25f) {
             continue;
index c3eea2ecb81b79377136ff4b968d5b2086ea3a9e..411d9180795516068f62e1688fab2fc2be76daa5 100644 (file)
@@ -650,7 +650,7 @@ struct server_prompt_cache {
 
     server_prompt_cache_state * alloc(const server_prompt & prompt, size_t state_size_main, size_t state_size_drft);
 
-    bool load(server_prompt & prompt, const server_tokens & tokens_new, llama_context * ctx_main, llama_context * ctx_drft, int32_t id_slot);
+    bool load(server_prompt & prompt, const server_tokens & tokens_new, llama_context * ctx_tgt, llama_context * ctx_dft, int32_t id_slot);
 
     void update();
 };