global server
request = {
"prompt": "I believe the meaning of life is",
- "temperature": 0.8,
- "top_k": 40,
+ "temperature": 0.2,
+ "top_k": 5,
"seed": 4242,
"n_predict": 16,
"return_tokens": True,
server.model_draft = None # disable draft model
server.spec_type = None
- server.backend_sampling = True
server.start()
res = server.make_request("POST", "/completion", data=request)
assert res.status_code == 200
# create new server with draft model
create_server()
- server.backend_sampling = True
server.start()
res = server.make_request("POST", "/completion", data=request)
assert res.status_code == 200