Claude, OpenClaw e la fine della tariffa fissa per gli agenti
Gli abbonamenti a Claude non alimentano più gli agenti
La falla silenziosa che ha alimentato un’onda di sperimentazione con gli agenti è ora chiusa.
Gli abbonamenti a Claude non alimentano più gli agenti
La falla silenziosa che ha alimentato un’onda di sperimentazione con gli agenti è ora chiusa.
Ricerca AI auto-ospitata con LLM locali
Vane è una delle voci più pragmatiche nel settore della “ricerca AI con citazioni”: un motore di risposta ospitato autonomamente che combina il recupero live sul web con LLM locali o cloud, mantenendo l’intera stack sotto il tuo controllo.
Coding agentico, ora con backend di modelli locali.
Claude Code non è un’autocompletamento con un marketing migliore. È uno strumento di coding agentic: legge la tua codebase, modifica i file, esegue comandi e si integra con i tuoi strumenti di sviluppo.
Installazione e avvio rapido di Hermes Agent per gli sviluppatori
Hermes Agent è un assistente AI auto-gestito e indipendente dal modello, che gira su una macchina locale o su un VPS a basso costo, funziona tramite interfaccia terminale e di messaggistica e migliora nel tempo trasformando i compiti ripetitivi in competenze riutilizzabili.
Installa TGI, rilascia velocemente, debugga più rapidamente.
Text Generation Inference (TGI) ha un’energia molto specifica. Non è il più nuovo arrivato nella strada dell’inferenza, ma è quello che ha già imparato come la produzione si rompe -
Velocità dei token di llama.cpp su 16 GB di VRAM (tabelle).
Qui confronto la velocità di diversi LLM (modelli linguistici di grandi dimensioni) in esecuzione su una GPU con 16 GB di VRAM, scegliendo il migliore per l’auto-hospitamento (self-hosting).
La RTX 5090 in Australia è scarsa e sopravvalutata.
L’Australia ha scorte di RTX 5090. A malapena. E se ne trovate una, pagherete un sovrapprezzo che sembra distaccato dalla realtà.
Accesso remoto a Ollama senza porte pubbliche
Ollama è al suo meglio quando viene trattato come un demone locale: la CLI e le tue applicazioni comunicano con un’API HTTP su loopback, e il resto della rete non viene a sapere della sua esistenza.
Log JSON interrogabili che si collegano alle tracce.
I log rappresentano un’interfaccia di debugging utilizzabile anche quando il sistema è in fiamme. Il problema è che i log in testo puro si deteriorano rapidamente: non appena è necessario filtrare, aggregare e configurare allarmi, si inizia a analizzare le frasi.
Server Ollama con approccio compose-first, GPU e persistenza.
Ollama funziona egregiamente su hardware nudo (bare metal). Diventa ancora più interessante quando lo si tratta come un servizio: un endpoint stabile, versioni bloccate, archiviazione persistente e una GPU che è disponibile o non lo è.
HTTPS per Ollama senza interrompere le risposte in streaming.
Eseguire Ollama dietro un proxy inverso è il modo più semplice per ottenere HTTPS, un controllo degli accessi opzionale e un comportamento di streaming prevedibile.
Embedding RAG - Python, Ollama, API OpenAI.
Se stai approfondendo la generazione potenziata dal recupero (RAG), questa sezione illustra le embeddings testuali in termini semplici: cosa sono, come si integrano nella ricerca e nel recupero, e come invocare due configurazioni locali comuni da Python utilizzando Ollama o un’API HTTP compatibile con OpenAI (come espongono molti server basati su llama.cpp).
Deploy basati su Git, CDN, crediti e compromessi.
Netlify è uno dei modi più amichevoli per gli sviluppatori per pubblicare siti Hugo e app web moderne con un flusso di lavoro di livello produzione: URL di anteprima per ogni pull request, deploy atomici, una CDN globale e funzionalità serverless e edge opzionali.
Streaming con stato, checkpoint, K8s, PyFlink, Go.
Apache Flink è un framework per elaborazioni con stato su flussi di dati limitati e illimitati.
Grafici, Cypher, vettori e rafforzamento delle operazioni.
Neo4j è la soluzione a cui si ricorre quando le relazioni sono i dati. Se il tuo dominio assomiglia a una lavagna piena di cerchi e frecce, forzare tutto in tabelle è doloroso.
Aggiorna i URL di spinta ai motori di ricerca dopo il deploy.
I siti statici e i blog cambiano ogni volta che si effettua un deployment. I motori di ricerca che supportano IndexNow possono apprendere questi cambiamenti senza attendere il prossimo crawl automatico.
Ricevi nuovi articoli su sistemi, infrastruttura e ingegneria AI.