Szybki start z llama.cpp: CLI i serwer
Uruchamiaj modele GGUF za pomocą CLI i serwera
llama.cpp to silnik inferencji w językach C/C++ dla modeli GGUF: llama-cli do interaktywnego czatu, llama-completion do skryptowych promptów oraz llama-server dla kompatybilnego z OpenAI interfejsu API HTTP.