Strumenti e piattaforme SEO self-hosted: guida open source

SEO open-source oltre i plugin per WordPress

Indice

Le piattaforme SEO self-hosted coprono ora crawler, dashboard di Search Console, strumenti di monitoraggio delle posizioni, server MCP e IA locale. Questa guida confronta le principali piattaforme open source e quali funzionalità sono disponibili senza API SEO a pagamento.

Il termine include sistemi molto diversi. Alcuni progetti funzionano solo con il tuo sito web e dati di ricerca di prima parte, mentre altri self-host l’interfaccia ma richiedono comunque DataForSEO, un provider commerciale SERP o un’altra API a pagamento per le loro funzionalità più preziose.

Pila SEO self-hosted: un crawler del sito, dati da Search Console e un LLM locale che alimentano un’unica dashboard

Una dashboard avvolta attorno a un servizio dati a pagamento è architettonicamente diversa da un crawler, un analizzatore di Search Console o un sistema di IA locale che continua a funzionare quando viene rimossa ogni chiave API commerciale. È questa differenza, e non la posizione del codice sorgente, a determinare quali piattaforme si adattano a una pila senza API a pagamento, ed è l’asse del confronto sottostante. Questi sistemi operano insieme alle pipeline di deployment e ai segnali di indicizzazione, ovvero l’infrastruttura di pubblicazione mappata nel hub Web Infrastructure di questo sito.

Cos’è una Piattaforma SEO Self-Hosted?

Una piattaforma SEO self-hosted esegue almeno lo strato applicativo su infrastrutture che controlli tu. A seconda del progetto, l’applicazione effettua il crawling dei siti web, analizza i dati di Search Console, monitora le posizioni, ispeziona i Core Web Vitals, genera report o espone funzionalità SEO agli agenti AI.

La domanda che distingue i progetti è da dove provengono i dati. Una piattaforma SEO commerciale tipica combina diversi set di dati costosi:

database parole chiave
+
raccolta SERP
+
crawler backlink
+
crawler del sito
+
Search Console
+
analytics
+
analisi del contenuto

I progetti open source replicano bene alcuni di questi strati. Il crawling dei siti, il SEO tecnico, l’analisi di Search Console, l’analisi delle pagine locali, i Core Web Vitals e le raccomandazioni assistite da LLM sono tutte soluzioni praticabili in self-host.

Altri strati sono molto più difficili. Un indice globale dei backlink richiede il crawling continuo di una parte sostanziale del web pubblico, e dataset affidabili di volumi di ricerca e SERP a livello mondiale richiedono either una raccolta dati su larga scala o l’accesso a fonti commerciali. I progetti open source che promettono dati simili ad Ahrefs ottengono in genere almeno parte di essi da un’altra API.

Quattro Tipi di Strumenti SEO Self-Hosted

L’ecosistema attuale si divide in quattro categorie.

Crawler tecnici

Questi ispezionano il sito web reale e rilevano link rotti, titoli duplicati, metadati mancanti, errori di canonical, problemi di intestazioni, catene di redirect e problemi di accessibilità.

Esempi:

In genere forniscono un valore sostanziale senza alcuna API SEO a pagamento.

Piattaforme di monitoraggio delle prestazioni di ricerca

Queste combinano i dati del crawling con informazioni di ricerca di prima parte, in particolare Google Search Console.

Esempi:

Per un sito web affermato, questa categoria è spesso più utile di un database di parole chiave generico perché funziona con impressioni reali, click, CTR, posizioni e le pagine che Google associa già al tuo dominio.

Strumenti di monitoraggio posizioni e SERP

Questi raccolgono i risultati dei motori di ricerca e monitorano le posizioni.

Esempi:

La difficoltà qui è operativa piuttosto che concettuale. I motori di ricerca limitano l’accesso automatizzato, modificano il markup, presentano CAPTCHA e personalizzano i risultati. Un sistema SERP self-hosted può funzionare, ma richiede più manutenzione rispetto all’utilizzo di un’API SERP commerciale.

Piattaforme SEO complete

Queste tentano di riunire in un unico prodotto ricerca di parole chiave, backlink, analisi dei concorrenti, audit del sito, monitoraggio delle posizioni e flussi di lavoro AI. L’esempio più noto è OpenSEO. Questi sistemi offrono un’interfaccia attraente, ma i loro dati esterni provengono spesso ancora da API commerciali, quindi ispeziona il percorso dei dati prima del deployment.

Confronto degli Strumenti SEO Self-Hosted

I conteggi di star e fork su GitHub sono snapshot approssimativi di settembre 2026. Sono segnali di adozione, non punteggi di qualità.

Sistema Tipo Star GitHub Fork UI Web CLI MCP LLM Locale API SEO a pagamento necessaria per il valore principale Licenza
OpenSEO Piattaforma SEO completa 20,5K 2,6K Sì Parziale Sì Non primario Sì, DataForSEO MIT
SerpBear Monitoraggio posizioni 2,1K 294 Sì No No No No, se si usano proxy propri MIT
LibreCrawl Crawler tecnico 980 206 Sì Limitato No No No MIT
SiteOne Crawler Crawler tecnico / QA 917 84 Report / desktop Sì No nativo Sì No MIT
CrawlSEO Piattaforma di monitoraggio 601 92 Sì No Sì Lato agente No MIT
SEO Skill CLI SEO / backend agente 532 42 No Sì Sì Lato agente No Apache-2.0
Scouter Crawler nativo AI 71 7 Sì Alcuni Sì Sì No MIT
OpenGSC Piattaforma GSC 27 19 Sì Limitato Sì Sì No per il core MIT
OpenSERP API SERP / CLI Vari Vari Documentazione API Sì Add-on No No MIT

La colonna più importante è se la funzionalità utile sopravvive quando vengono rimosse le chiavi delle API SEO commerciali. Le 20.000 star di OpenSEO riflettono un ampio fascino e una proposta all-in-one, non l’autosufficienza, e un progetto giovane come Scouter può offrire un’architettura LLM locale più interessante con molte meno star. Prima di scegliere, è meglio chiedersi:

Il progetto risolve il mio problema?
Il suo core funziona ancora senza un'API a pagamento?
Posso esportare i miei dati?
Posso automatizzarlo?
Il progetto è mantenuto?
Posso sostituire singoli componenti in seguito?

OpenSEO

OpenSEO è il progetto più grande in questo confronto, con circa 20,5 migliaia di star GitHub e 2,6 migliaia di fork al momento della scrittura. Il progetto si descrive come un’alternativa open source a Semrush e Ahrefs e fornisce ricerca di parole chiave, monitoraggio delle posizioni, intelligence competitiva, backlink, audit del sito, visibilità AI, MCP e competenze per agenti.

La sua caratteristica più forte è l’integrazione del prodotto: un’applicazione moderna con contesto di progetto, flussi di lavoro SEO e un’interfaccia MCP per client come Claude Code, Codex, OpenClaw e Hermes, invece di assemblare diverse utility da riga di comando.

La dipendenza dai dati è l’altra metà del quadro. La documentazione del progetto richiede esplicitamente una chiave API di DataForSEO per i dati SEO, e DataForSEO è un servizio commerciale separato con pagamento per utilizzo. Il self-hosting di OpenSEO non esegue in self-host il dataset sottostante. L’architettura è:

flowchart LR A[Sito web] --> B[OpenSEO] C[Agente AI] -->|MCP| B B --> D[DataForSEO] B --> E[Google Search Console] B --> F[Database OpenSEO]

Se usi già DataForSEO, OpenSEO è un piano di controllo open source attorno ad esso, e il self-hosting ti dà comunque il controllo su progetti, credenziali, stato dell’applicazione e integrazione degli agenti. Non è un sostituto per dati SEO esterni a pagamento.

Migliore uso

Scegli OpenSEO se vuoi un’interfaccia moderna in stile Semrush e sei disponibile a pagare DataForSEO direttamente invece di pagare per un abbonamento SaaS SEO tradizionale. Non sceglierlo se il requisito è che il sistema mantenga la maggior parte del suo valore senza alcuna API SEO a pagamento.

SiteOne Crawler

SiteOne Crawler è uno degli strumenti più autosufficienti nell’elenco. Ha circa 917 star GitHub e 84 fork ed è progettato come un crawler web cross-platform per SEO, sicurezza, accessibilità, prestazioni e garanzia della qualità.

I controlli SEO coprono lo strato tecnico: metadati, link, redirect, struttura della pagina, codici di stato, sitemap e problemi correlati. SiteOne ispeziona anche header di sicurezza, TLS, accessibilità, caching e prestazioni, il che lo rende utile per siti web gestiti da sviluppatori in cui il SEO fa parte di un processo più ampio di qualità del deployment.

Rendering del browser per siti moderni

SiteOne può opzionalmente rendere le pagine attraverso Chromium usando il Chrome DevTools Protocol. Questo è importante per React, Vue, Angular e altri siti in cui link o contenuti importanti appaiono solo dopo l’esecuzione di JavaScript. Per sistemi statici come Hugo, il rendering del browser è solitamente non necessario, ma è utile quando si testano applicazioni incorporate, widget lato client o pagine con comportamento JavaScript significativo.

Supporto LLM locale

Lo strato AI opzionale di SiteOne supporta OpenAI, Anthropic, Gemini e endpoint arbitrari compatibili con OpenAI. Il percorso compatibile con OpenAI può puntare a Ollama, vLLM, LocalAI, gateway self-hosted o altri server compatibili, in modo che un modello locale possa ispezionare pagine selezionate senza inviare il contenuto a un provider cloud.

Un’architettura completamente locale:

flowchart LR A[Sito web] --> B[SiteOne] B --> C[Risultati crawl deterministici] C --> D[API locale compatibile con OpenAI] D --> E[Ollama / llama.cpp / vLLM] E --> F[Suggerimenti SEO]

SiteOne determina i fatti come descrizioni mancanti o link rotti, mentre il modello propone una formulazione migliore o riassume i risultati.

Gate di qualità CI/CD

Un flusso di lavoro pratico:

flowchart LR A[Push Git] --> B[Build sito web] B --> C[Anteprima locale] C --> D[Crawl SiteOne] D --> E{Problemi critici?} E -->|Sì| F[Fallimento pipeline] E -->|No| G[Deploy]

Il crawling viene eseguito contro un’anteprima locale prima del deployment, e la pipeline fallisce su problemi critici. Questo fornisce ai team di ingegneria un controllo automatizzato invece di una dashboard che viene riveduta occasionalmente.

Migliore uso

Scegli SiteOne per siti web tecnici, generatori di siti statici, pipeline CI/CD o qualsiasi ambiente in cui i controlli SEO dovrebbero comportarsi come controlli automatizzati di qualità del software. È un’opzione forte quando la priorità è un valore locale genuino piuttosto che dataset SEO esterni.

LibreCrawl

LibreCrawl è un crawler SEO web-based multi-utente con circa 980 star GitHub e 206 fork. Il progetto lo posiziona come un’alternativa open source ai crawler desktop come Screaming Frog.

LibreCrawl estrae titoli delle pagine, descrizioni, intestazioni, link, informazioni di risposta e altri dati tecnici SEO. Supporta il rendering JavaScript, profondità di crawl configurabile, filtraggio URL, proxy, comportamento robots.txt ed esportazioni in CSV, XLSX, JSON e XML. A differenza di un crawler solo desktop, funziona come applicazione web e supporta utenti concorrenti con sessioni separate.

Dipendenze esterne

Il crawler core funziona localmente. L’integrazione con PageSpeed Insights può usare l’API di Google e trarre beneficio da una chiave API per limiti più alti, ma il crawler stesso non richiede un servizio dati SEO commerciale.

Poiché LibreCrawl opera contro il sito web reso e non il CMS, funziona con:

Hugo
WordPress
Ghost
Drupal
Next.js
Astro
React
siti web personalizzati

Limitazioni

LibreCrawl non offre l’architettura orientata agli agenti di Scouter o SEO Skill: non c’è un flusso di lavoro MCP centrale e l’integrazione LLM locale non è il suo punto focale principale. La sua forza è il crawling diretto e l’esportazione dei dati.

Migliore uso

Scegli LibreCrawl se vuoi un crawler open source basato su browser con un flusso di lavoro umano familiare e un buon supporto per l’esportazione.

Scouter

Scouter è un progetto più giovane, ma la sua architettura è la più ambiziosa in questo elenco per i flussi di lavoro SEO nativi AI. Ha circa 71 star GitHub e 7 fork, quindi la sua storia di deployment è piccola rispetto a OpenSEO o SerpBear. Il set di funzionalità documentato include un’interfaccia web self-hosted, supporto multi-utente, rendering JavaScript, PageRank interno, estrattor XPath e regex personalizzati, accesso SQL ai dati di crawl, categorizzazione AI delle pagine, generazione AI in blocco e un server MCP nativo.

Bring your own LLM

Scouter supporta modelli hosted e locali; le opzioni locali documentate sono Ollama e vLLM. L’architettura risultante:

flowchart TD A[Sito web] --> B[Crawler Scouter] B --> C[Database crawl] C --> D[UI Web] C --> E[MCP] C --> F[Assistente AI] F --> G[Ollama locale / vLLM] E --> H[Agente AI]

Questo è più vicino a un “database SEO per agenti” che a un crawler tradizionale.

Integrazione MCP

Senza MCP, un assistente AI di solito ha bisogno di report incollati nel suo contesto o script personalizzati scritti attorno a file esportati. Con MCP, l’agente chiede direttamente al sistema SEO prove strutturate di crawl, attiva operazioni e recupera i risultati rilevanti quando necessario. Flussi di lavoro come questo diventano realistici:

Trova pagine con link interni deboli.

Per ogni pagina:
- mostra il conteggio dei link in entrata
- identifica le pagine semanticamente correlate
- propone link
- non modifica il contenuto

Il crawler fornisce i fatti, il modello fornisce l’interpretazione.

Limitazioni

Scouter è nuovo. Un progetto del 2026 con circa 60 commit e una base di utenti piccola è un’infrastruttura promettente piuttosto che uno standard di produzione provato, e il suo stack più complesso significa più componenti operativi rispetto a un crawler a singolo binario come SiteOne.

Migliore uso

Scegli Scouter quando MCP, accesso web multi-utente, SQL sui dati di crawl e integrazione AI locale sono abbastanza importanti da giustificare l’esecuzione di una piattaforma più giovane.

SEO Skill (iannuttall/seo)

SEO Skill adotta un approccio diverso: invece di una grande dashboard browser, fornisce un CLI locale seo, una libreria TypeScript, una skill agente confezionata e un server MCP. Il progetto ha circa 532 star GitHub e 42 fork.

Il flusso di lavoro combina prove dal tuo stesso crawl, Google Search Console e analytics opzionali in report che umani o agenti AI possono ispezionare e su cui agire. Comandi utili:

seo report
seo quick-wins
seo second-page
seo technical-watch
seo refresh-priorities
seo report --json
seo mcp serve

Il progetto espone oltre 70 strumenti di audit SEO attraverso la sua CLI e lo strato MCP.

Dati di prima parte prima di tutto

SEO Skill tratta i provider di ricerca a pagamento come arricchimento opzionale piuttosto che infrastruttura obbligatoria. Può usare dati di crawl locali, Google Search Console e dati di analytics, e può opzionalmente connettersi a DataForSEO, Semrush o Ahrefs. Se nessuno dei provider commerciali è configurato, il flusso di lavoro di prima parte funziona comunque.

Per un sito web affermato, una query con

8.000 impressioni
posizione media 8,2
CTR 1,1%

descrive la tua opportunità reale, mentre una stima di terze parti che afferma che una parola chiave correlata riceve 12.000 ricerche al mese descrive un mercato che non puoi verificare dai tuoi dati.

Architettura agente

flowchart LR A[Sito web] --> B[Crawl SEO Skill] C[Google Search Console] --> B D[Analytics] --> B B --> E[Server MCP] E --> F[Hermes / Claude / Codex] F --> G[LLM Locale]

Il LLM riceve prove strutturate dallo strumento SEO invece di fare scraping delle dashboard o indovinare le metriche.

Limitazioni

SEO Skill non è una dashboard SEO multi-utente rifinita. Se vuoi un’applicazione visiva che il personale di marketing può sfogliare tutto il giorno, un altro sistema potrebbe adattarsi meglio. La ricerca esterna su concorrenti, backlink e parole chiave rimane limitata a meno che non vengano aggiunti provider di terze parti opzionali.

Migliore uso

Scegli SEO Skill se vuoi un backend SEO scriptabile e primo per gli agenti costruito attorno a prove di prima parte piuttosto che una grande GUI. Per sviluppatori, publisher di siti statici e flussi di lavoro Git automatizzati, è un’ottima scelta.

CrawlSEO

CrawlSEO è una dashboard di monitoraggio SEO self-hosted con circa 601 star GitHub e 92 fork. Combina Google Search Console, un crawler del sito, Core Web Vitals, opportunità SEO e accesso MCP, che la colloca tra un crawler e una piattaforma SEO completa.

Le fonti di dati principali sono:

  • Google Search Console
  • crawling locale del sito
  • dati Core Web Vitals / PageSpeed
  • osservazioni storiche archiviate

CrawlSEO può fornire monitoraggio continuo senza un provider SEO a pagamento.

Ricerca esterna opzionale

CrawlSEO può integrarsi con DataForSEO per la ricerca di parole chiave e informazioni sui backlink, ma quelle funzionalità sono opzionali, e Google Autocomplete fornisce un fallback gratuito per i suggerimenti di parole chiave. Lo stack core funziona senza un dataset SEO esterno:

GSC
+
crawler
+
Core Web Vitals
+
MCP

Strumenti MCP

CrawlSEO espone dieci strumenti MCP che coprono siti, panoramica del sito, parole chiave, pagine, traffico, crawling, problemi di crawl, Core Web Vitals e opportunità. Un agente può fare domande come:

Quali pagine hanno perso impressioni questo mese e hanno anche problemi tecnici di crawl?

Questa correlazione tra le prestazioni di ricerca e lo stato tecnico è più azionabile di un punteggio SEO generico.

Migliore uso

Scegli CrawlSEO se vuoi una dashboard self-hosted persistente costruita attorno a Search Console e al monitoraggio continuo piuttosto che audit one-off. È particolarmente adatta per siti affermati che ricevono già impressioni significative da Google.

OpenGSC

OpenGSC è un’altra piattaforma centrata su Search Console. È un progetto giovane, con circa 27 star e 19 fork, ma ha accumulato un set di funzionalità sostanziale. La proposta di valore principale: Search Console contiene preziosi dati SEO di prima parte, ma l’interfaccia stessa di Google è limitata per l’analisi longitudinale, il monitoraggio multi-sito, il rilevamento del decadimento del contenuto e i flussi di lavoro degli agenti.

OpenGSC aggiunge:

  • dashboard GSC multi-sito
  • monitoraggio delle posizioni dai dati di prima parte
  • query a distanza ravvicinata (striking-distance)
  • rilevamento del decadimento del contenuto
  • analisi della cannibalizzazione
  • audit del sito
  • strumenti di indicizzazione
  • allerte e digest
  • MCP
  • strumenti SEO AI opzionali

Audit del sito integrato

Il crawler opera con zero API SEO esterne e controlla fino a centinaia di pagine per link interni rotti, problemi di titoli, descrizioni mancanti, problemi H1, pagine noindex, discrepanze canonical, contenuto magro, testo alt delle immagini mancanti e risposte lente. La piattaforma mantiene funzionalità locali utili anche quando le integrazioni di ricerca opzionali sono disattivate.

AI e provider esterni

OpenGSC supporta più provider AI ed endpoint personalizzati compatibili con OpenAI, il che rende possibile l’inferenza locale a seconda del server configurato. Alcune funzionalità di ricerca estese possono usare DataForSEO o altri provider esterni, ma non sono necessarie per la dashboard Search Console e lo strato di audit locale.

Attenzione alle funzionalità di indicizzazione opzionali

OpenGSC include un’infrastruttura opzionale orientata all’indicizzazione che va oltre l’analisi normale di Search Console. Valuta quelle funzionalità indipendentemente; non sono richieste per il monitoraggio SEO ordinario. Per i deployment conservativi, la configurazione sensata è:

Analytics GSC
+
audit del sito
+
MCP
+
AI locale opzionale

anziché abilitare tutti i moduli disponibili.

Migliore uso

Scegli OpenGSC se Search Console è il centro del tuo flusso di lavoro SEO e vuoi un’interfaccia self-hosted attorno ai tuoi dati sulle prestazioni di ricerca.

SerpBear

SerpBear è uno dei monitor di posizione open source più maturi, con circa 2,1 migliaia di star GitHub e 294 fork. La sua finalità è più ristretta rispetto a OpenSEO o CrawlSEO: monitorare dove un dominio appare su Google per un insieme configurato di parole chiave.

Fornisce domini illimitati, parole chiave monitorate illimitate, storico delle posizioni, notifiche via email, un’API SERP, integrazione con Google Search Console, ricerca di parole chiave tramite integrazione con Google Ads e accesso PWA/mobile.

Il problema della raccolta SERP

L’applicazione, il database, lo scheduler e l’UI sono self-hosted, ma i risultati di Google devono comunque essere raccolti in qualche modo. SerpBear può usare i tuoi proxy, servizi di scraping o API SERP commerciali. Se operi i tuoi proxy, nessuna API SEO commerciale è intrinsecamente richiesta, ma l’onere operativo si sposta su di te:

API SERP commerciale:
  costo in denaro
  basso onere operativo

scraping self-hosted:
  basso costo API
  onere operativo più alto

Migliore uso

Scegli SerpBear quando il monitoraggio delle posizioni è il requisito principale e sei a tuo agio nel gestire lo strato di acquisizione SERP da solo. È uno strumento specializzato che funziona bene accanto a un crawler o a una piattaforma Search Console.

OpenSERP

OpenSERP non è una dashboard SEO completa. È infrastruttura: un’API SERP e un CLI self-hosted.

Supporta la ricerca su Google, Bing, DuckDuckGo, Yandex, Baidu e Ecosia, e restituisce risultati normalizzati tramite JSON e altri formati. OpenSERP può anche esporre funzionalità SERP come riassunti AI, caselle di risposta, People Also Ask e ricerche correlate, e può opzionalmente estrarre il contenuto dalle pagine dei risultati.

Perché è importante

Gli strumenti SEO commerciali nascondono spesso l’acquisizione SERP dietro un’applicazione rifinita. OpenSERP fornisce il componente di livello inferiore, il che lo rende utile per la costruzione di monitoraggio delle posizioni, scoperta dei concorrenti, analisi dell’intento SERP, clustering di query, strumenti di ricerca per agenti e pipeline di ricerca locale.

Architettura di esempio:

flowchart LR A[Elenco parole chiave] --> B[OpenSERP] B --> C[Motori di ricerca] B --> D[Repository locale risultati] D --> E[Analisi SEO] E --> F[LLM Locale]

Il progetto fornisce anche SDK e un’integrazione MCP, rendendolo adatto come infrastruttura dietro altri sistemi. Per il panorama più ampio della ricerca self-hosted, consulta Oltre Google: Guida ai Motori di Ricerca Alternativi.

Limitazioni

Eseguire l’API da solo non rende i motori di ricerca più facili da scavare. CAPTCHA, blocchi, limiti di velocità, variazioni regionali e modifiche al layout dei risultati rimangono problemi reali, e i proxy possono diventare necessari alla fine a una scala significativa. OpenSERP è meglio trattato come una fonte SERP locale controllata, non come un sostituto gratuito di un dataset di ricerca globale commerciale.

Migliore uso

Scegli OpenSERP se vuoi possedere la pipeline di raccolta SERP o hai bisogno dei risultati dei motori di ricerca come input per l’automazione SEO personalizzata.

Quali Strumenti Funzionano Senza API SEO a Pagamento?

Questo confronto è più utile di “open source contro proprietario”.

Sistema Audit tecnico Analisi GSC SERP/monitoraggio posizioni AI Locale Utile con zero API SEO a pagamento?
OpenSEO Sì Sì Sì Orientato agli agenti In parte, ma la ricerca principale dipende da DataForSEO
SiteOne Eccellente No No Sì Sì
LibreCrawl Eccellente No No No Sì
Scouter Eccellente No focus GSC core No Sì Sì
SEO Skill Sì Eccellente Prima parte / provider opzionali Tramite agente Sì
CrawlSEO Sì Eccellente Basato su GSC Tramite agente Sì
OpenGSC Sì Eccellente Basato su GSC Sì Sì
SerpBear No Sì Eccellente No Sì, con scraping/proxy propri
OpenSERP No No Infrastruttura SERP No Sì, con limiti operativi

Le funzioni più facili da self-host sono quelle basate sul tuo stesso sito e sui tuoi stessi dati di ricerca.

Hugo, WordPress, Ghost, o qualcos’altro?

La maggior parte di questi sistemi non si cura quale CMS o generatore di siti statici ha prodotto il sito web. Un crawler vede HTTP e HTML, quindi Hugo, WordPress, Ghost, Drupal, Astro, Next.js, Jekyll e applicazioni personalizzate possono tutti essere analizzati dallo stesso crawler.

La differenza appare quando vuoi modificare il sito. Un plugin SEO di WordPress può aggiornare direttamente i metadati dei post perché funziona all’interno di WordPress. SiteOne o Scouter non possono sapere automaticamente come la tua front matter di Hugo è strutturata a meno che un altro strato di integrazione non lo dica. La separazione:

flowchart LR A[CMS / generatore di siti statici] --> B[Sito web pubblicato] B --> C[Sistema SEO self-hosted] C --> D[Risultati] D --> E[Umano o agente AI] E --> F[Modifiche alla sorgente] F --> A

Per i flussi di lavoro di sviluppo moderni, questa separazione è spesso un vantaggio piuttosto che un problema.

SEO Self-Hosted per WordPress

Per WordPress, una piattaforma SEO self-hosted si trova normalmente accanto a un plugin SEO convenzionale:

flowchart TD A[WordPress] A --> B[The SEO Framework / SEOPress] B --> C[Metadata / schema / sitemap] A --> D[Sito pubblicato] D --> E[SiteOne / CrawlSEO / Scouter] E --> F[Risultati SEO]

Il plugin controlla:

URL canonical
metadati robots
schema
sitemap XML
titoli e descrizioni
redirect

La piattaforma esterna osserva:

salute tecnica
struttura del crawl
prestazioni di ricerca
Core Web Vitals
cambiamenti delle posizioni
opportunità di contenuto

Queste sono responsabilità complementari; i confronti plugin-per-plugin di Yoast, Rank Math, SEOPress, The SEO Framework e Slim SEO appartengono al lato WordPress dello stack, non allo strato di monitoring descritto qui.

SEO Self-Hosted per Hugo

I generatori di siti statici come Hugo traggono particolare vantaggio dagli strumenti SEO esterni perché di solito mancano di un grande ecosistema di plugin CMS. Un buon flusso di lavoro Hugo tratta il SEO come la qualità del software:

flowchart LR A[Markdown] --> B[Build Hugo] B --> C[Sito anteprima] C --> D[SiteOne] D --> E{I controlli tecnici passano?} E -->|No| F[Correggi sorgente] E -->|Sì| G[Deploy]

Se pubblici Hugo su S3, il passaggio di crawl si inserisce nella stessa pipeline che costruisce e pubblica il sito, e le notifiche IndexNow completano il crawler avvisando i motori quando esistono nuovi URL.

Il monitoraggio in produzione usa poi Search Console:

flowchart LR A[Sito Hugo pubblicato] --> B[Google] B --> C[Search Console] A --> D[Crawler locale] C --> E[SEO Skill / CrawlSEO] D --> E E --> F[Opportunità prioritarie]

Il flusso di lavoro valuta il sito web che utenti e motori di ricerca ricevono realmente, non la vista dell’editor.

LLM Locali nel SEO Self-Hosted

I LLM locali aggiungono un altro strato, ma non dovrebbero diventare la fonte di verità. Un modello è buono in:

  • riscrittura dei titoli
  • proposta di descrizioni
  • clustering delle query
  • riassunto dei risultati del crawl
  • identificazione dei gap semantici
  • suggerimento di link interni
  • confronto della struttura del contenuto
  • bozza dei piani di aggiornamento

È scarso come fonte autoritativa per:

  • codici di stato HTTP
  • posizioni
  • click
  • impressioni
  • stato di indicizzazione
  • correttezza dei canonical
  • conteggi dei backlink
  • Core Web Vitals

L’architettura:

flowchart LR A[Crawler / GSC / fonte SERP] --> B[Prove strutturate] B --> C[LLM Locale] C --> D[Raccomandazione] D --> E[Rivedere]

invece di chiedere al modello “Fai l’audit del mio sito e dimmi come mi posiziono.”

SiteOne e Scouter forniscono percorsi nativi verso i modelli locali. SEO Skill e CrawlSEO sono utili quando il LLM vive in un agente esterno come Hermes, Claude Code o un altro client MCP. Eseguire il modello sulla tua infrastruttura mantiene il tuo contenuto lì, lo stesso argomento del più ampio self-hosting LLM e sovranità AI applicato al SEO. Per il server del modello stesso, la scheda rapida CLI di Ollama copre il servizio e la gestione dei modelli.

MCP nel SEO Self-Hosted

Model Context Protocol cambia il modo in cui il software SEO interagisce con i sistemi AI.

Senza MCP:

strumento SEO
-> esporta CSV
-> incolla in AI
-> fa domanda

Con MCP:

agente AI
-> richiede prove di crawl
-> richiede prove GSC
-> richiede URL interessati
-> analizza
-> propone modifica

L’agente recupera solo le prove di cui ha bisogno. I progetti in questo confronto che supportano già MCP: OpenSEO, SEO Skill, CrawlSEO, Scouter, OpenGSC e OpenSERP attraverso il suo pacchetto MCP. Se hai costruito il lato server di questa integrazione, le note di implementazione del server MCP in Go mostrano come appare un server MCP dall’interno.

Un agente SEO progettato correttamente potrebbe:

1. Trova pagine che stanno perdendo impressioni.
2. Controlla se le pagine hanno problemi di crawl.
3. Legge le loro query Search Console dominanti.
4. Trova link interni deboli.
5. Propone una modifica.
6. Modifica la sorgente su un branch Git.
7. Esegue la validazione tecnica.
8. Apre una pull request.

Il sistema SEO rimane il fornitore di prove, e l’agente diventa il motore del flusso di lavoro.

Cosa si può effettivamente sostituire localmente?

Uno stack self-hosted realistico può sostituire una parte sostanziale della funzionalità SEO commerciale.

Capacità Opzione self-hosted pratica
Crawling tecnico SiteOne, LibreCrawl, Scouter
Controlli dei metadati SiteOne, LibreCrawl, Scouter
Analisi dei link interni Scouter, SiteOne, esportazioni crawl
Prestazioni di ricerca GSC + SEO Skill / CrawlSEO / OpenGSC
Decadimento del contenuto Piattaforme basate su GSC
Core Web Vitals CrawlSEO, Lighthouse, PageSpeed
Monitoraggio posizioni SerpBear, OpenSERP
Ispezione SERP OpenSERP
Analisi AI Ollama locale / vLLM / llama.cpp
Automazione agente Sistemi SEO abilitati per MCP
Gate di qualità CI SiteOne
Monitoraggio storico CrawlSEO / OpenGSC

Le due lacune maggiori rimangono i dati globali sulle parole chiave e i backlink.

Cosa è difficile da Self-Host?

Volume di ricerca globale

Il volume di ricerca sembra semplice quando viene visualizzato come un singolo numero:

"local llm" -> 12.100 ricerche/mese

ma ottenere quel numero in modo affidabile richiede l’accesso a un dataset molto grande. Google Search Console mostra solo le query per cui il tuo stesso sito è già apparso; non può descrivere il panorama della domanda per un argomento che non hai mai coperto. Google Ads提供一些 informazioni sulle parole chiave, ma costruire un database globale di parole chiave simile a Semrush localmente non è realistico per la maggior parte degli individui.

L’analisi dei backlink è più intensiva in termini di infrastruttura. Ahrefs, Semrush, Majestic e simili aziende fanno continuamente il crawling di enormi porzioni del web, normalizzano gli URL, identificano i link, eliminano i duplicati e mantengono indici storici. Un individuo può effettuare il crawling di siti concorrenti selezionati o monitorare i link scoperti tramite Search Console e analytics, ma questo non è equivalente a un database di backlink su scala web. I prodotti SEO open source integrano DataForSEO, Ahrefs o un altro provider per queste due categorie perché i dati sottostanti sono costosi da raccogliere.

Uno Stack Completamente Self-Hosted Pratico

Se l’obiettivo è un SEO utile senza un’API SEO a pagamento, combina componenti specializzati invece di cercare una singola applicazione gigante:

flowchart TD SITE[Sito web] GSC[Google Search Console] CRAWL[SiteOne] SEO[SEO Skill] SERP[OpenSERP] AGENT[Agente AI] LLM[LLM Locale] GIT[Git / CMS] SITE --> CRAWL SITE --> GSC GSC --> SEO CRAWL --> SEO SERP --> SEO SEO --> AGENT AGENT --> LLM AGENT --> GIT

Le responsabilità:

SiteOne:
  crawl tecnico
  controlli di regressione CI

SEO Skill:
  Search Console
  analisi opportunità di prima parte
  MCP

OpenSERP:
  osservazioni SERP opzionali

LLM Locale:
  interpretazione e compiti linguistici

Agente:
  orchestrazione del flusso di lavoro

Git/CMS:
  modifiche di pubblicazione controllate

Questo stack non può riprodurre ogni funzione di Ahrefs, ma copre la maggior parte del lavoro coinvolto nel miglioramento di un sito web esistente.

Scegliere uno Strumento per il Tuo Requisito

Requisito principale Strumento
Controlli tecnici deterministici, uso CI/CD, AI locale opzionale SiteOne
Crawler web user-friendly con esportazioni e rendering JavaScript LibreCrawl
Crawler nativo AI: MCP, accesso SQL, UI multi-utente, Ollama/vLLM locale Scouter
Backend CLI/MCP che combina prove di crawl e Search Console SEO Skill
Dashboard persistente: GSC, crawling, Core Web Vitals, accesso agente CrawlSEO
Dashboard centrata su Search Console: decadimento, query a distanza ravvicinata, accesso agente OpenGSC
Monitoraggio posizioni parole chiave, proxy autogestiti o provider SERP SerpBear
Infrastruttura SERP grezza self-hosted per script e agenti OpenSERP
Prodotto integrato in stile Semrush con DataForSEO sottostante OpenSEO

Stack Raccomandati per Tipo di Sito Web

Piccolo blog WordPress

Un plugin SEO convenzionale per WordPress più un crawling tecnico occasionale è sufficiente:

The SEO Framework / Yoast / SEOPress
+
SiteOne o LibreCrawl

C’è poca ragione per distribuire cinque servizi per un sito piccolo.

Pubblicazione WordPress affermata

Plugin SEO WordPress
+
CrawlSEO o SEO Skill
+
Search Console
+
crawler tecnico

Aggiungi un LLM locale solo se hai abbastanza contenuto da rendere l’analisi automatizzata un risparmio di tempo significativo.

Sito tecnico statico Hugo

SiteOne
+
SEO Skill
+
Search Console
+
Git CI

Questo rende il SEO parte del flusso di lavoro di ingegneria.

Ambiente self-hosted ad alta intensità di AI

Scouter o SiteOne
+
SEO Skill
+
agente MCP
+
Ollama locale / llama.cpp / vLLM
+
flusso di lavoro di review Git

È qui che il self-hosting offre la maggiore libertà architetturale.

Conclusione

L’ecosistema SEO open source è abbastanza grande da rendere il “SEO self-hosted” una categoria reale piuttosto che una raccolta di script abbandonati. Nessuna singola applicazione open source riproduce ogni funzionalità utile di Ahrefs o Semrush senza dati esterni: i database globali di parole chiave e gli indici di backlink su scala web rimangono costosi perché i dati sottostanti sono costosi da raccogliere.

L’opportunità pratica è negli strati che puoi possedere: crawling tecnico, analisi di prima parte di Search Console, osservazione SERP locale a scala moderata, interpretazione di quelle prove tramite LLM locale, MCP come interfaccia con gli agenti e CI/CD come gate di regressione. Per la maggior parte dei siti web gestiti tecnicamente, questa combinazione è più preziosa rispetto alla ricreazione di una suite commerciale, e risponde alla domanda che conta: quali capacità ti servono, quali dati puoi raccogliere tu stesso e dove un dataset esterno aggiunge davvero valore.

Riferimenti

Iscriviti

Ricevi nuovi articoli su sistemi, infrastruttura e ingegneria AI.