Self-Hosting

Como o Ollama Processa Requisições Paralelas

Como o Ollama Processa Requisições Paralelas

Compreenda a concorrência do Ollama, o enfileiramento e como ajustar OLLAMA_NUM_PARALLEL para solicitações paralelas estáveis.

Este guia explica como o Ollama gerencia solicitações paralelas (concorrência, filas e limites de recursos) e como ajustá-lo usando a variável de ambiente OLLAMA_NUM_PARALLEL (e parâmetros relacionados).

Testando o Deepseek-R1 no Ollama

Testando o Deepseek-R1 no Ollama

Comparando dois modelos deepseek-r1 com dois modelos base

A primeira geração de modelos de raciocínio da DeepSeek com desempenho comparável ao OpenAI-o1, incluindo seis modelos densos destilados do DeepSeek-R1 com base em Llama e Qwen.