const double n_gen_second = 1e3 / t_token_generation * n_decoded;
SLT_INF(*this,
- "\n"
- "prompt eval time = %10.2f ms / %5d tokens (%8.2f ms per token, %8.2f tokens per second)\n"
- " eval time = %10.2f ms / %5d tokens (%8.2f ms per token, %8.2f tokens per second)\n"
+ "prompt eval time = %10.2f ms / %5d tokens (%8.2f ms per token, %8.2f tokens per second)\n",
+ t_prompt_processing, n_prompt_tokens_processed, t_prompt, n_prompt_second);
+
+ SLT_INF(*this,
+ " eval time = %10.2f ms / %5d tokens (%8.2f ms per token, %8.2f tokens per second)\n",
+ t_token_generation, n_decoded, t_gen, n_gen_second);
+
+ SLT_INF(*this,
" total time = %10.2f ms / %5d tokens\n",
- t_prompt_processing, n_prompt_tokens_processed, t_prompt, n_prompt_second,
- t_token_generation, n_decoded, t_gen, n_gen_second,
t_prompt_processing + t_token_generation, n_prompt_tokens_processed + n_decoded);
+ SLT_INF(*this,
+ " graphs reused = %10d\n",
+ llama_perf_context(ctx_tgt).n_reused);
+
if (n_draft_total > 0) {
const float draft_ratio = (float) n_draft_accepted / n_draft_total;
- SLT_CNT(*this,
- "draft acceptance rate = %0.5f (%5d accepted / %5d generated)\n",
- draft_ratio, n_draft_accepted, n_draft_total
- );
+ SLT_INF(*this,
+ "draft acceptance = %0.5f (%5d accepted / %5d generated)\n",
+ draft_ratio, n_draft_accepted, n_draft_total);
}
common_speculative_print_stats(spec);