Benchmarks LLM avec llama.cpp sur 16 Go de VRAM (vitesse et contexte)
Vitesse de génération des jetons de llama.cpp sur 16 Go de VRAM (tableaux).
Ici, je compare la vitesse de plusieurs LLMs exécutés sur GPU avec 16 Go de VRAM, et je choisis le meilleur pour l’auto-hébergement.