Быстрый старт с llama.cpp: CLI и сервер
Запуск моделей GGUF в CLI и сервере
llama.cpp — это движок инференса на C/C++ для моделей в формате GGUF: llama-cli для интерактивного чата, llama-completion для скриптованных промптов и llama-server для HTTP API, совместимого с OpenAI.