Frontend per LLM

Quando ho iniziato a sperimentare con gli LLM, le loro interfacce utente erano in fase di sviluppo attivo e ora alcune di esse sono davvero buone.

Jan - interfaccia multiplatform per LLM

Jan

  • Jan è disponibile per Windows, Linux e Mac.

Ha temi scuri, chiari e trasparenti.

Frontend LLM Jan - finestra principale

Può connettersi a diversi backend esistenti come Anthropic, Cohere, OpenAI, NvidiaNIM, MistralAI, ecc., e ospitare modelli in autonomia - vedere la sezione Cortex nello screenshot sottostante - che mostra Jan aver scaricato e ospitato localmente Llama3 8b q4 e Phi3 medium (q4).

Frontend LLM Jan - opzioni di configurazione

Vantaggi (Cosa mi è piaciuto):

  • Interfaccia intuitiva
  • Possibilità di sperimentare con la temperatura del modello, topp, penalità di frequenza e presenze e prompt di sistema.
  • Fornisce un server API

Svantaggi:

  • In qualche modo lento sul mio sistema operativo basato su Ubuntu. Su Windows ha funzionato senza problemi.
  • Può connettersi a molti backend, ma tutti sono gestiti. Sarebbe bello avere l’opzione Ollama.
  • Non ci sono molte varianti di modelli disponibili per l’auto-ospitalità in Cortex. Non ci sono nemmeno troppe opzioni di quantizzazione.
  • Sì, Huggingface gguf è fantastico. Ma volevo
    • riutilizzare ciò che ollama ha già scaricato e caricato nella VRAM
    • non ospitare lo stesso modello ovunque

KoboldAI

KoboldAI

Molto prominente

Silly Tavern

Silly Tavern

Un altro molto versatile

LLM Studio

LLM Studio non è la mia interfaccia utente preferita per gli LLM, ma ha un migliore accesso ai modelli di huggingface.

Ollama da riga di comando

Sì, è anche un’interfaccia utente, solo una da riga di comando.

Bisogna eseguire per l’LLM llama3.1:

ollama run llama3.1

quando hai finito, invia un comando per uscire dalla riga di comando di ollama:

/bye

cURL Ollama

Installa cUrl se non l’hai ancora fatto

sudo apt-get install curl

Per chiamare l’LLM locale mistral nemo q8 ospitato su ollama - crea un file locale con il prompt p.json:

{
  model: mistral-nemo:12b-instruct-2407-q8_0,
  prompt: Cos'è il post-modernismo?,
  stream: false
}

e ora esegui nel terminale bash

curl -X POST http://localhost:11434/api/generate -d @p.json > p-result.json

il risultato sarà nel file p-result.json

se vuoi solo stampare il risultato:

curl -X POST http://localhost:11434/api/generate -d @p.json

Inoltre:

Non ho testato questi, ma è un elenco piuttosto completo di interfacce utente per LLM:

Guida rapida per Vane (Perplexica 2.0) con Ollama e llama.cpp

Guida rapida per Vane (Perplexica 2.0) con Ollama e llama.cpp

Ricerca AI auto-ospitata con LLM locali

Vane è una delle voci più pragmatiche nel settore della “ricerca AI con citazioni”: un motore di risposta ospitato autonomamente che combina il recupero live sul web con LLM locali o cloud, mantenendo l’intera stack sotto il tuo controllo.

Interfacce di chat per istanze locali di Ollama

Interfacce di chat per istanze locali di Ollama

Panoramica rapida delle interfacce utente più prominenti per Ollama nel 2025

Locally hosted Ollama consente di eseguire modelli linguistici di grandi dimensioni sul proprio computer, ma l’utilizzo tramite riga di comando non è particolarmente utente-friendly. Ecco diversi progetti open-source che forniscono interfacce simili a ChatGPT che si connettono a un Ollama locale.

Self-hosting di Perplexica - con Ollama

Self-hosting di Perplexica - con Ollama

Eseguire un servizio simile a Copilot in locale? È semplice!

È davvero entusiasmante! Invece di chiamare Copilot o Perplexity.ai e rivelare al mondo intero cosa stai cercando, ora puoi ospitare un servizio simile sul tuo PC o laptop!

Iscriviti

Ricevi nuovi articoli su sistemi, infrastruttura e ingegneria AI.