Self-Hosting

Come Ollama gestisce le richieste parallele

Come Ollama gestisce le richieste parallele

Capire la concorrenza, l'accodeamento e come configurare OLLAMA_NUM_PARALLEL per richieste parallele stabili.

Questa guida spiega come Ollama gestisce le richieste parallele (concorrenza, code e limiti delle risorse) e come ottimizzarla utilizzando la variabile d’ambiente OLLAMA_NUM_PARALLEL (e le relative impostazioni).

Test di Deepseek-R1 su Ollama

Test di Deepseek-R1 su Ollama

Confronto tra due modelli deepseek-r1 e due modelli base

DeepSeek’s prima generazione di modelli di ragionamento con prestazioni paragonabili a quelle di OpenAI-o1, inclusi sei modelli densi distillati da DeepSeek-R1 basati su Llama e Qwen.