Hardware

Cómo Ollama gestiona las solicitudes paralelas

Cómo Ollama gestiona las solicitudes paralelas

Comprender la concurrencia y la encolación en Ollama, así como cómo ajustar OLLAMA_NUM_PARALLEL para solicitudes paralelas estables.

Esta guía explica cómo Ollama maneja las solicitudes paralelas (concurrencia, colas y límites de recursos) y cómo ajustarlo utilizando la variable de entorno OLLAMA_NUM_PARALLEL (y configuraciones relacionadas).

Prueba de velocidad de modelos de lenguaje grandes

Prueba de velocidad de modelos de lenguaje grandes

Probemos la velocidad de los LLM en GPU frente a CPU

Comparando la velocidad de predicción de varias versiones de LLMs: llama3 (Meta/Facebook), phi3 (Microsoft), gemma (Google), mistral (open source) en CPU y GPU.