talk-llama : sync llama.cpp

This commit is contained in:
Georgi Gerganov
2025-12-18 08:20:56 +02:00
parent 698348aadc
commit 6c22e792cb
27 changed files with 3211 additions and 2665 deletions
+1 -1
View File
@@ -596,7 +596,7 @@ static void llama_model_quantize_impl(const std::string & fname_inp, const std::
}
std::vector<std::string> splits = {};
llama_model_loader ml(fname_inp, splits, use_mmap, /*check_tensors*/ true, kv_overrides, nullptr);
llama_model_loader ml(fname_inp, splits, use_mmap, /*check_tensors*/ true, /*no_alloc*/ false, kv_overrides, nullptr);
ml.init_mappings(false); // no prefetching
llama_model model(llama_model_default_params());