Benchmarks de LLM con 16 GB de VRAM usando llama.cpp (velocidad y contexto)
Velocidad de tokens de llama.cpp con 16 GB de VRAM (tablas).
Aquí estoy comparando la velocidad de varios LLM que se ejecutan en una GPU con 16GB de VRAM, y eligiendo el mejor para autoalojar.