// load the model and initialize llama_context
// this may also be called to resume from sleeping state
- bool load_model(const common_params & params) {
+ bool load_model(common_params & params) {
bool is_resume = sleeping;
SRV_INF("loading model '%s'\n", params.model.path.c_str());
llama_init = common_init_from_params(params_base);
+ // propagate model-metadata sampling defaults back to caller
+ params.sampling = params_base.sampling;
+
model = llama_init->model();
ctx = llama_init->context();
server_context::server_context() : impl(new server_context_impl()) {}
server_context::~server_context() = default;
-bool server_context::load_model(const common_params & params) {
+bool server_context::load_model(common_params & params) {
return impl->load_model(params);
}
// load the model and initialize llama_context
// returns true on success
- bool load_model(const common_params & params);
+ bool load_model(common_params & params);
// this function will block main thread until termination
void start_loop();