Herramientas y plataformas de SEO autoalojadas: guía de código abierto

SEO de código abierto más allá de los complementos de WordPress

Índice

El SEO autoalojado ahora abarca rastreadores, paneles de Search Console, seguidores de posicionamiento, servidores MCP y IA local. Esta guía compara las principales plataformas de código abierto y qué funciones funcionan sin APIs de SEO de pago.

El término cubre sistemas muy diferentes. Algunos proyectos funcionan solo con tu propio sitio web y datos de búsqueda de primera parte, mientras que otros alojan la interfaz de forma autoalojada pero aún requieren DataForSEO, un proveedor comercial de SERP, o otra API de pago para sus funciones más valiosas.

Pila de SEO autoalojada: un rastreador de sitios, datos de Search Console y un LLM local alimentando un solo panel

Un panel envuelto alrededor de un servicio de datos de pago es arquitectónicamente diferente de un rastreador, un analizador de Search Console o un sistema de IA local que sigue funcionando cuando se eliminan todas las claves de API comerciales. Esa diferencia, y no la ubicación del código fuente, decide qué plataformas se ajustan a una pila sin API de pago, y es el eje de la comparación a continuación. Estos sistemas funcionan junto a las líneas de implementación (deploy pipelines) y las señales de indexación: la infraestructura de publicación mapeada en el Hub de Infraestructura Web de este sitio.

¿Qué es una plataforma de SEO autoalojada?

Una plataforma de SEO autoalojada ejecuta al menos la capa de aplicación en infraestructura que tú controlas. Dependiendo del proyecto, la aplicación rastrea sitios web, analiza datos de Search Console, sigue el posicionamiento, inspecciona Core Web Vitals, genera informes o expone funciones de SEO a agentes de IA.

La pregunta que separa los proyectos es de dónde proviene los datos. Una plataforma comercial de SEO típica combina varios conjuntos de datos costosos:

keyword database
+
SERP collection
+
backlink crawler
+
site crawler
+
Search Console
+
analytics
+
content analysis

Los proyectos de código abierto reproducen bien algunas de estas capas. El rastreo de sitios, el SEO técnico, el análisis de Search Console, el análisis de páginas local, los Core Web Vitals y las recomendaciones asistidas por LLM son todas prácticas de autoalojar.

Otras capas son mucho más difíciles. Un índice global de backlinks requiere un rastreo continuo de una parte sustancial de la web pública, y los conjuntos de datos confiables de volumen de palabras clave y SERP a nivel mundial requieren要么 una recolección de datos a gran escala o el acceso a fuentes comerciales. Los proyectos de código abierto que prometen datos similares a Ahrefs suelen obtener al menos parte de ellos de otra API.

Cuatro tipos de herramientas de SEO autoalojadas

El ecosistema actual se separa en cuatro categorías.

Rastreadores técnicos

Estos inspeccionan el sitio web real y detectan enlaces rotos, títulos duplicados, metadatos faltantes, errores canónicos, problemas de encabezados, cadenas de redirección y problemas de accesibilidad.

Ejemplos:

Normalmente proporcionan un valor sustancial sin ninguna API de SEO de pago.

Plataformas de rendimiento de búsqueda y monitoreo

Estos combinan datos de rastreo con información de búsqueda de primera parte, particularmente Google Search Console.

Ejemplos:

Para un sitio web establecido, esta categoría a menudo es más útil que una base de datos genérica de palabras clave porque funciona con impresiones reales, clics, CTR, posiciones y las páginas que Google ya asocia con tu dominio.

Herramientas de posicionamiento y SERP

Estas recogen resultados de motores de búsqueda y siguen las posiciones.

Ejemplos:

La dificultad aquí es operativa y no conceptual. Los motores de búsqueda limitan el acceso automatizado, cambian la marca, presentan CAPTCHAs y personalizan los resultados. Un sistema de SERP autoalojado puede funcionar, pero requiere más mantenimiento que llamar a una API de SERP comercial.

Plataformas de SEO integrales

Estas intentan llevar la investigación de palabras clave, backlinks, análisis de la competencia, auditorías de sitios, seguimiento de posiciones y flujos de trabajo de IA en un solo producto. El ejemplo más visible es OpenSEO. Estos sistemas proporcionan una interfaz atractiva, y sus datos externos a menudo todavía provienen de APIs comerciales, por lo que inspecciona la ruta de los datos antes de la implementación.

Comparación de herramientas de SEO autoalojadas

Las estrellas y bifurcaciones de GitHub son instantáneas aproximadas de septiembre de 2026. Son señales de adopción, no puntajes de calidad.

Sistema Tipo Estrellas de GitHub Bifurcaciones Interfaz Web CLI MCP LLM Local ¿Necesita API de SEO de pago para el valor central? Licencia
OpenSEO Plataforma de SEO integral 20.5K 2.6K Sí Parcial Sí No principal Sí, DataForSEO MIT
SerpBear Seguidor de posicionamiento 2.1K 294 Sí No No No No, si se usan propios proxies MIT
LibreCrawl Rastreador técnico 980 206 Sí Limitado No No No MIT
SiteOne Crawler Rastreador técnico / QA 917 84 Informes / escritorio Sí No nativo Sí No MIT
CrawlSEO Plataforma de monitoreo 601 92 Sí No Sí Lado del agente No MIT
SEO Skill CLI de SEO / backend de agente 532 42 No Sí Sí Lado del agente No Apache-2.0
Scouter Rastreador nativo de IA 71 7 Sí Algunos Sí Sí No MIT
OpenGSC Plataforma GSC 27 19 Sí Limitado Sí Sí No para lo central MIT
OpenSERP API de SERP / CLI Varía Varía Documentación de la API Sí Complemento No No MIT

La columna más importante es si la funcionalidad útil sobrevive cuando se eliminan las claves de API de SEO comerciales. Las 20,000 estrellas de OpenSEO reflejan un amplio atractivo y una propuesta todo en uno, no la autosuficiencia, y un proyecto joven como Scouter puede ofrecer una arquitectura de LLM local más interesante con muchas menos estrellas. Antes de elegir, es mejor preguntar:

Does the project solve my problem?
Does its core still work without a paid API?
Can I export my data?
Can I automate it?
Is the project maintained?
Can I replace individual components later?

OpenSEO

OpenSEO es el proyecto más grande en esta comparación, con aproximadamente 20.500 estrellas de GitHub y 2.600 bifurcaciones en el momento de escribir. El proyecto se describe a sí mismo como una alternativa de código abierto a Semrush y Ahrefs y proporciona investigación de palabras clave, seguimiento de posiciones, inteligencia de la competencia, backlinks, auditorías de sitios, visibilidad de IA, MCP y habilidades de agente.

Su función más fuerte es la integración de producto: una aplicación moderna con contexto de proyecto, flujos de trabajo de SEO y una interfaz MCP para clientes como Claude Code, Codex, OpenClaw y Hermes, en lugar de ensamblar varias utilidades de línea de comandos.

La dependencia de datos es la otra mitad de la imagen. La documentación del proyecto exige explícitamente una clave de API de DataForSEO para datos de SEO, y DataForSEO es un servicio comercial separado de pago por uso. Autoalojar OpenSEO no autoaloja el conjunto de datos subyacente. La arquitectura es:

flowchart LR A[Website] --> B[OpenSEO] C[AI Agent] -->|MCP| B B --> D[DataForSEO] B --> E[Google Search Console] B --> F[OpenSEO database]

Si ya usas DataForSEO, OpenSEO es un plano de control de código abierto alrededor de este, y el autoalojamiento todavía te da control sobre los proyectos, credenciales, estado de la aplicación e integración de agentes. No es un reemplazo para los datos externos de SEO de pago.

Mejor uso

Elige OpenSEO cuando quieras una interfaz moderna estilo Semrush y estés cómodo pagando directamente a DataForSEO en lugar de pagar por una suscripción tradicional a un SaaS de SEO. No lo elijas si el requisito es que el sistema retenga la mayor parte de su valor sin ninguna API de SEO de pago en absoluto.

SiteOne Crawler

SiteOne Crawler es una de las herramientas más autosuficientes de la lista. Tiene alrededor de 917 estrellas de GitHub y 84 bifurcaciones y está diseñado como un rastreador de sitios web multiplataforma para SEO, seguridad, accesibilidad, rendimiento y aseguramiento de la calidad.

Las comprobaciones de SEO cubren la capa técnica: metadatos, enlaces, redirecciones, estructura de la página, códigos de estado, mapas del sitio y problemas relacionados. SiteOne también inspecciona encabezados de seguridad, TLS, accesibilidad, caché y rendimiento, lo que lo hace útil para sitios web gestionados por desarrolladores donde el SEO es parte de un proceso más amplio de calidad de implementación.

Renderizado de navegador para sitios modernos

SiteOne puede renderizar páginas opcionalmente a través de Chromium usando el Protocolo de Herramientas de Desarrollo de Chrome (Chrome DevTools Protocol). Esto es importante para React, Vue, Angular y otros sitios donde los enlaces o el contenido importante solo aparecen después de la ejecución de JavaScript. Para sistemas estáticos como Hugo, el renderizado de navegador generalmente no es necesario, pero es útil al probar aplicaciones incrustadas, widgets del lado del cliente o páginas con un comportamiento significativo de JavaScript.

Soporte para LLM local

La capa de IA opcional de SiteOne admite OpenAI, Anthropic, Gemini y puntos finales compatibles con OpenAI arbitrarios. La ruta compatible con OpenAI puede apuntar a Ollama, vLLM, LocalAI, portales autoalojados o otros servidores compatibles, por lo que un modelo local puede inspeccionar páginas seleccionadas sin enviar contenido a un proveedor en la nube.

Una arquitectura totalmente local:

flowchart LR A[Website] --> B[SiteOne] B --> C[Deterministic crawl results] C --> D[Local OpenAI-compatible API] D --> E[Ollama / llama.cpp / vLLM] E --> F[SEO suggestions]

SiteOne determina hechos como descripciones faltantes o enlaces rotos, mientras que el modelo propone una mejor redacción o resume los hallazgos.

Puerta de calidad CI/CD

Un flujo de trabajo práctico:

flowchart LR A[Git push] --> B[Build website] B --> C[Local preview] C --> D[SiteOne crawl] D --> E{Critical issues?} E -->|Yes| F[Fail pipeline] E -->|No| G[Deploy]

El rastreo se ejecuta contra una vista previa local antes de la implementación, y la línea de producción falla ante problemas críticos. Eso da a los equipos de ingeniería una comprobación automatizada en lugar de un panel que se revisa ocasionalmente.

Mejor uso

Elige SiteOne para sitios web técnicos, generadores de sitios estáticos, líneas de CI/CD o cualquier entorno donde las comprobaciones de SEO deban comportarse como comprobaciones automáticas de calidad de software. Es una opción fuerte cuando la prioridad es un valor local genuino en lugar de conjuntos de datos externos de SEO.

LibreCrawl

LibreCrawl es un rastreador de SEO multiusuario basado en la web con alrededor de 980 estrellas de GitHub y 206 bifurcaciones. El proyecto lo posiciona como una alternativa de código abierto a los rastreadores de escritorio como Screaming Frog.

LibreCrawl extrae títulos de páginas, descripciones, encabezados, enlaces, información de respuesta y otros datos técnicos de SEO. Admite renderizado de JavaScript, profundidad de rastreo configurable, filtrado de URL, proxies, comportamiento de robots.txt y exportaciones a CSV, XLSX, JSON y XML. A diferencia de un rastreador solo de escritorio, se ejecuta como una aplicación web y admite usuarios concurrentes con sesiones separadas.

Dependencias externas

El rastreador central funciona localmente. La integración con PageSpeed Insights puede usar la API de Google y se beneficia de una clave de API para límites más altos, pero el rastreador en sí no requiere un servicio de datos de SEO comercial.

Dado que LibreCrawl opera contra el sitio web renderizado y no contra el CMS, funciona con:

Hugo
WordPress
Ghost
Drupal
Next.js
Astro
React
custom websites

Limitaciones

LibreCrawl no ofrece la arquitectura orientada a agentes de Scouter o SEO Skill: no hay un flujo de trabajo MCP central, y la integración de LLM local no es su enfoque principal. Su fortaleza es el rastreo directo y la exportación de datos.

Mejor uso

Elige LibreCrawl cuando quieras un rastreador de código abierto basado en el navegador con un flujo de trabajo humano familiar y buen soporte de exportación.

Scouter

Scouter es un proyecto más joven, pero su arquitectura es la más ambiciosa de esta lista para flujos de trabajo de SEO nativos de IA. Tiene aproximadamente 71 estrellas de GitHub y 7 bifurcaciones, por lo que su historial de despliegue es diminuto en comparación con OpenSEO o SerpBear. El conjunto de funciones documentado incluye una interfaz web autoalojada, soporte multiusuario, renderizado de JavaScript, PageRank interno, extractores personalizados de XPath y regex, acceso SQL a los datos de rastreo, categorización de páginas por IA, generación masiva por IA y un servidor MCP nativo.

Trae tu propio LLM

Scouter admite modelos hospedados y locales; las opciones locales documentadas son Ollama y vLLM. La arquitectura resultante:

flowchart TD A[Website] --> B[Scouter crawler] B --> C[Crawl database] C --> D[Web UI] C --> E[MCP] C --> F[AI assistant] F --> G[Local Ollama / vLLM] E --> H[AI agent]

Esto es más cercano a una “base de datos de SEO para agentes” que a un rastreador tradicional.

Integración de MCP

Sin MCP, un asistente de IA generalmente necesita informes pegados en su contexto o scripts personalizados escritos alrededor de archivos exportados. Con MCP, el agente pregunta directamente al sistema de SEO por evidencia de rastreo estructurada, desencadena operaciones y recupera hallazgos relevantes según sea necesario. Flujos de trabajo como este se vuelven realistas:

Find pages with weak internal linking.

For each page:
- show inlink count
- identify semantically related pages
- propose links
- do not modify content

El rastreador suministra los hechos, el modelo proporciona la interpretación.

Limitaciones

Scouter es nuevo. Un proyecto de 2026 con alrededor de 60 commits y una base de usuarios pequeña es una infraestructura prometedora más que un estándar de producción probado, y su pila más compleja significa más componentes operativos que un rastreador de un solo binario como SiteOne.

Mejor uso

Elige Scouter cuando MCP, acceso web multiusuario, SQL sobre datos de rastreo e integración de IA local sean lo suficientemente importantes como para justificar la ejecución de una plataforma más joven.

SEO Skill (iannuttall/seo)

SEO Skill toma un enfoque diferente: en lugar de un gran panel de navegador, proporciona una CLI local seo, una biblioteca de TypeScript, una habilidad de agente empaquetada y un servidor MCP. El proyecto tiene alrededor de 532 estrellas de GitHub y 42 bifurcaciones.

El flujo de trabajo combina la evidencia de tu propio rastreo, Google Search Console y analíticas opcionales en informes que humanos o agentes de IA pueden inspeccionar y actuar sobre ellos. Comandos útiles:

seo report
seo quick-wins
seo second-page
seo technical-watch
seo refresh-priorities
seo report --json
seo mcp serve

El proyecto expone más de 70 herramientas de auditoría de SEO a través de su capa CLI y MCP.

Datos de primera parte primero

SEO Skill trata a los proveedores de investigación de pago como enriquecimiento opcional en lugar de infraestructura obligatoria. Puede usar datos de rastreo local, Google Search Console y datos de analíticas, y puede conectarse opcionalmente a DataForSEO, Semrush o Ahrefs. Si ninguno de los proveedores comerciales está configurado, el flujo de trabajo de primera parte sigue funcionando.

Para un sitio web establecido, una consulta con

8,000 impressions
average position 8.2
CTR 1.1%

describe tu oportunidad real, mientras que una estimación de un tercero que afirma que una palabra clave relacionada recibe 12,000 búsquedas al mes describe un mercado que no puedes verificar desde tus propios datos.

Arquitectura de agente

flowchart LR A[Website] --> B[SEO Skill crawl] C[Google Search Console] --> B D[Analytics] --> B B --> E[MCP server] E --> F[Hermes / Claude / Codex] F --> G[Local LLM]

El LLM recibe evidencia estructurada de la herramienta de SEO en lugar de raspar paneles o suponer métricas.

Limitaciones

SEO Skill no es un panel de SEO multiusuario pulido. Si quieres una aplicación visual que el personal de marketing pueda navegar todo el día, otro sistema puede encajar mejor. La investigación externa de la competencia, backlinks y palabras clave sigue siendo limitada a menos que se añadan proveedores de terceros opcionales.

Mejor uso

Elige SEO Skill cuando quieras un backend de SEO primero para el agente, scriptable, construido alrededor de la evidencia de primera parte en lugar de una gran GUI. Para desarrolladores, editores de sitios estáticos y flujos de trabajo de Git automatizados, es una gran elección.

CrawlSEO

CrawlSEO es un panel de monitoreo de SEO autoalojado con alrededor de 601 estrellas de GitHub y 92 bifurcaciones. Combina Google Search Console, un rastreador de sitios, Core Web Vitals, oportunidades de SEO y acceso MCP, lo que lo sitúa entre un rastreador y una plataforma de SEO integral.

Las fuentes de datos centrales son:

  • Google Search Console
  • rastreo local del sitio
  • datos de Core Web Vitals / PageSpeed
  • observaciones históricas almacenadas

CrawlSEO puede proporcionar monitoreo continuo sin un proveedor de SEO de pago.

Investigación externa opcional

CrawlSEO puede integrarse con DataForSEO para la investigación de palabras clave y la información de backlinks, pero esas funciones son opcionales, y Google Autocomplete proporciona una alternativa gratuita para sugerencias de palabras clave. La pila central se ejecuta sin un conjunto de datos de SEO externo:

GSC
+
crawler
+
Core Web Vitals
+
MCP

Herramientas MCP

CrawlSEO expone diez herramientas MCP que cubren sitios, resumen del sitio, palabras clave, páginas, tráfico, rastreo, problemas de rastreo, Core Web Vitals y oportunidades. Un agente puede hacer preguntas como:

Which pages lost impressions this month and also have technical crawl issues?

Esa correlación entre el rendimiento de búsqueda y el estado técnico es más accionable que una puntuación de SEO genérica.

Mejor uso

Elige CrawlSEO si quieres un panel autoalojado persistente construido alrededor de Search Console y el monitoreo continuo en lugar de auditorías de una sola vez. Es particularmente adecuado para sitios establecidos que ya reciben impresiones de búsqueda de Google significativas.

OpenGSC

OpenGSC es otra plataforma centrada en Search Console. Es un proyecto joven, con aproximadamente 27 estrellas y 19 bifurcaciones, pero ha acumulado un conjunto de funciones sustancial. La propuesta central: Search Console contiene valiosos datos de SEO de primera parte, pero la interfaz propia de Google es limitada para el análisis longitudinal, el monitoreo entre sitios, la detección de deterioro del contenido y los flujos de trabajo de agentes.

OpenGSC añade:

  • paneles GSC multi-sitio
  • seguimiento de posiciones desde datos de primera parte
  • consultas a distancia de impacto
  • detección de deterioro del contenido
  • análisis de canibalización
  • auditoría de sitios
  • herramientas de indexación
  • alertas y resúmenes
  • MCP
  • herramientas de IA de SEO opcionales

Auditoría de sitio integrada

El rastreador opera con cero APIs externas de SEO y comprueba hasta cientos de páginas por enlaces internos rotos, problemas de título, descripciones faltantes, problemas de H1, páginas noindex, discrepancias canónicas, contenido delgado, texto alt de imágenes faltante y respuestas lentas. La plataforma retiene una funcionalidad local útil incluso cuando sus integraciones de investigación opcionales están desactivadas.

IA y proveedores externos

OpenGSC admite múltiples proveedores de IA y puntos finales compatibles con OpenAI personalizados, lo que hace posible la inferencia local dependiendo del servidor configurado. Algunas funciones de investigación extendidas pueden usar DataForSEO u otros proveedores externos, pero no son necesarias para el panel de Search Console y la capa de auditoría local.

Precaución sobre las funciones opcionales de indexación

OpenGSC incluye infraestructura opcional orientada a la indexación que va más allá del análisis normal de Search Console. Evalúa esas funciones de forma independiente; no son necesarias para el monitoreo de SEO ordinario. Para despliegues conservadores, la configuración sensata es:

GSC analytics
+
site audit
+
MCP
+
optional local AI

en lugar de habilitar todos los módulos disponibles.

Mejor uso

Elige OpenGSC si Search Console es el centro de tu flujo de trabajo de SEO y quieres una interfaz autoalojada alrededor de tus propios datos de rendimiento de búsqueda.

SerpBear

SerpBear es uno de los seguidores de posicionamiento de código abierto más maduros, con alrededor de 2.100 estrellas de GitHub y 294 bifurcaciones. Su propósito es más estrecho que OpenSEO o CrawlSEO: seguir dónde aparece un dominio en Google para un conjunto configurado de palabras clave.

Proporciona dominios ilimitados, palabras clave seguidas ilimitadas, historial de clasificaciones, notificaciones por correo electrónico, una API de SERP, integración con Google Search Console, investigación de palabras clave a través de la integración con Google Ads y acceso PWA/móvil.

El problema de la recopilación de SERP

La aplicación, la base de datos, el programador y la interfaz son autoalojados, pero los resultados de Google aún tienen que recopilarse de alguna manera. SerpBear puede usar tus propios proxies, servicios de raspado o APIs de SERP comerciales. Si operas tus propios proxies, no se requiere inherentemente una API de SEO comercial, pero la carga operativa se transfiere a ti:

commercial SERP API:
  money cost
  low operational burden

self-hosted scraping:
  low API cost
  higher operational burden

Mejor uso

Elige SerpBear cuando el seguimiento de posiciones sea el requisito principal y estés cómodo gestionando la capa de adquisición de SERP por ti mismo. Es una herramienta especializada que funciona bien junto a un rastreador o una plataforma de Search Console.

OpenSERP

OpenSERP no es un panel de SEO completo. Es infraestructura: una API de SERP y CLI autoalojada.

Admite búsqueda en Google, Bing, DuckDuckGo, Yandex, Baidu y Ecosia, y devuelve resultados normalizados a través de JSON y otros formatos. OpenSERP también puede exponer funciones de SERP como resúmenes de IA, cuadros de respuesta, People Also Ask y búsquedas relacionadas, y puede extraer opcionalmente contenido de las páginas de resultados.

Por qué es importante

Las herramientas comerciales de SEO a menudo ocultan la adquisición de SERP detrás de una aplicación pulida. OpenSERP proporciona el componente de nivel inferior, lo que lo hace útil para construir seguimiento de posiciones, descubrimiento de la competencia, análisis de intención de SERP, agrupación de consultas, herramientas de búsqueda para agentes y tuberías de investigación local.

Arquitectura de ejemplo:

flowchart LR A[Keyword list] --> B[OpenSERP] B --> C[Search engines] B --> D[Local result store] D --> E[SEO analysis] E --> F[Local LLM]

El proyecto también proporciona SDKs y una integración MCP, lo que lo hace adecuado como infraestructura detrás de otros sistemas. Para el panorama general de la búsqueda autoalojada, ver Más allá de Google: Guía de Motores de Búsqueda Alternativos.

Limitaciones

Ejecutar la API tú mismo no hace que los motores de búsqueda sean más fáciles de raspar. Los CAPTCHAs, el bloqueo, los límites de velocidad, la variación regional y los cambios en el diseño de los resultados siguen siendo problemas reales, y los proxies pueden volverse necesarios eventualmente a escala significativa. OpenSERP se trata mejor como una fuente local de SERP controlada, no como un sustituto gratuito para un conjunto de datos de búsqueda global comercial.

Mejor uso

Elige OpenSERP cuando quieras poseer la tubería de recopilación de SERP o necesites resultados de motores de búsqueda como entrada para automatización de SEO personalizada.

¿Qué herramientas funcionan sin APIs de SEO de pago?

Esta comparación es más útil que “código abierto versus propietario”.

Sistema Auditoría técnica Análisis GSC SERP/seguimiento de posiciones IA local ¿Útil con cero APIs de SEO de pago?
OpenSEO Sí Sí Sí Orientado a agentes Parcialmente, pero la investigación central depende de DataForSEO
SiteOne Excelente No No Sí Sí
LibreCrawl Excelente No No No Sí
Scouter Excelente No enfoque GSC central No Sí Sí
SEO Skill Sí Excelente Primera parte/proveedores opcionales A través de agente Sí
CrawlSEO Sí Excelente Basado en GSC A través de agente Sí
OpenGSC Sí Excelente Basado en GSC Sí Sí
SerpBear No Sí Excelente No Sí, con propio raspado/proxies
OpenSERP No No Infraestructura de SERP No Sí, limitado operativamente

Las funciones más fáciles de autoalojar son las basadas en tu propio sitio y tus propios datos de búsqueda.

¿Hugo, WordPress, Ghost o algo más?

La mayoría de estos sistemas no le importa qué CMS o generador de sitios estáticos produjo el sitio web. Un rastreador ve HTTP y HTML, por lo que Hugo, WordPress, Ghost, Drupal, Astro, Next.js, Jekyll y aplicaciones personalizadas pueden ser analizados todos por el mismo rastreador.

La diferencia aparece cuando quieres modificar el sitio. Un plugin de SEO de WordPress puede actualizar directamente los metadatos de la publicación porque se ejecuta dentro de WordPress. SiteOne o Scouter no pueden saber automáticamente cómo está estructurada tu front matter de Hugo a menos que otra capa de integración les diga. La separación:

flowchart LR A[CMS / static-site generator] --> B[Published website] B --> C[Self-hosted SEO system] C --> D[Findings] D --> E[Human or AI agent] E --> F[Source changes] F --> A

Para flujos de trabajo de desarrollo modernos, esta separación a menudo es una ventaja en lugar de un problema.

SEO autoalojado para WordPress

Para WordPress, una plataforma de SEO autoalojada normalmente se sitúa junto a un plugin de SEO convencional:

flowchart TD A[WordPress] A --> B[The SEO Framework / SEOPress] B --> C[Metadata / schema / sitemap] A --> D[Published site] D --> E[SiteOne / CrawlSEO / Scouter] E --> F[SEO findings]

El plugin controla:

canonical URLs
robots metadata
schema
XML sitemaps
titles and descriptions
redirects

La plataforma externa observa:

technical health
crawl structure
search performance
Core Web Vitals
rank changes
content opportunities

Estas son responsabilidades complementarias; las comparaciones plugin por plugin de Yoast, Rank Math, SEOPress, The SEO Framework y Slim SEO pertenecen al lado de WordPress de la pila, no a la capa de monitoreo descrita aquí.

SEO autoalojado para Hugo

Los generadores de sitios estáticos como Hugo se benefician particularmente de las herramientas de SEO externas porque generalmente carecen de un gran ecosistema de plugins de CMS. Un buen flujo de trabajo de Hugo trata el SEO como la calidad del software:

flowchart LR A[Markdown] --> B[Hugo build] B --> C[Preview site] C --> D[SiteOne] D --> E{Technical checks pass?} E -->|No| F[Fix source] E -->|Yes| G[Deploy]

Si despliegas Hugo a S3, el paso de rastreo encaja en la misma tubería que construye y publica el sitio, y las notificaciones de IndexNow complementan al rastreador diciendo a los motores cuándo existen nuevas URLs.

El monitoreo de producción luego usa Search Console:

flowchart LR A[Published Hugo site] --> B[Google] B --> C[Search Console] A --> D[Local crawler] C --> E[SEO Skill / CrawlSEO] D --> E E --> F[Prioritized opportunities]

El flujo de trabajo evalúa el sitio web que los usuarios y los motores de búsqueda reciben realmente, no la visión del editor sobre él.

LLM locales en SEO autoalojado

Los LLM locales añaden otra capa, pero no deben convertirse en la fuente de verdad. Un modelo es bueno en:

  • reescribir títulos
  • proponer descripciones
  • agrupar consultas
  • resumir hallazgos de rastreo
  • identificar vacíos semánticos
  • sugerir enlaces internos
  • comparar la estructura del contenido
  • redactar planes de actualización

Es deficiente como fuente autoritativa para:

  • códigos de estado HTTP
  • clasificaciones
  • clics
  • impresiones
  • estado de indexación
  • corrección canónica
  • conteos de backlinks
  • Core Web Vitals

La arquitectura:

flowchart LR A[Crawler / GSC / SERP source] --> B[Structured evidence] B --> C[Local LLM] C --> D[Recommendation] D --> E[Review]

en lugar de pedirle al modelo “Audita mi sitio y dime cómo se posiciona”.

SiteOne y Scouter proporcionan rutas nativas a modelos locales. SEO Skill y CrawlSEO son útiles cuando el LLM vive en un agente externo como Hermes, Claude Code u otro cliente MCP. Ejecutar el modelo en tu propia infraestructura mantiene tu contenido allí, el mismo argumento que el más amplio de autoalojamiento de LLM y soberanía de IA aplicado al SEO. Para el propio servidor de modelo, la hoja de referencia de CLI de Ollama cubre el servicio y la gestión de modelos.

MCP en SEO autoalojado

El Protocolo de Contexto del Modelo (Model Context Protocol) cambia cómo el software de SEO interactúa con los sistemas de IA.

Sin MCP:

SEO tool
-> export CSV
-> paste into AI
-> ask question

Con MCP:

AI agent
-> request crawl evidence
-> request GSC evidence
-> request affected URLs
-> analyze
-> propose change

El agente recupera solo la evidencia que necesita. Los proyectos en esta comparación que ya admiten MCP: OpenSEO, SEO Skill, CrawlSEO, Scouter, OpenGSC y OpenSERP a través de su paquete MCP. Si has construido el lado del servidor de esta integración, las notas de implementación de servidores MCP en Go muestran cómo se ve un servidor MCP desde dentro.

Un agente de SEO diseñado adecuadamente podría:

1. Find pages losing impressions.
2. Check whether the pages have crawl issues.
3. Read their dominant Search Console queries.
4. Find weak internal linking.
5. Propose a change.
6. Modify the source on a Git branch.
7. Run technical validation.
8. Open a pull request.

El sistema de SEO sigue siendo el proveedor de evidencia, y el agente se convierte en el motor del flujo de trabajo.

¿Qué puede reemplazarse realmente localmente?

Una pila autoalojada realista puede reemplazar una parte sustancial de la funcionalidad comercial de SEO.

Capacidad Opción autoalojada práctica
Rastreo técnico SiteOne, LibreCrawl, Scouter
Comprobaciones de metadatos SiteOne, LibreCrawl, Scouter
Análisis de enlaces internos Scouter, SiteOne, exportaciones de rastreo
Rendimiento de búsqueda GSC + SEO Skill / CrawlSEO / OpenGSC
Deterioro del contenido Plataformas basadas en GSC
Core Web Vitals CrawlSEO, Lighthouse, PageSpeed
Seguimiento de posiciones SerpBear, OpenSERP
Inspección de SERP OpenSERP
Análisis de IA Local Ollama / vLLM / llama.cpp
Automatización de agentes Sistemas de SEO habilitados para MCP
Puertas de calidad CI SiteOne
Monitoreo histórico CrawlSEO / OpenGSC

Los dos vacíos principales siguen siendo los datos globales de palabras clave y los backlinks.

¿Qué es difícil de autoalojar?

Volumen de palabras clave global

El volumen de búsqueda parece simple cuando se muestra como un solo número:

"local llm" -> 12,100 searches/month

pero obtener ese número de manera confiable requiere acceso a un conjunto de datos muy grande. Google Search Console solo muestra consultas para las cuales tu propio sitio ya apareció; no puede describir el panorama de la demanda para un tema que nunca has cubierto. Google Ads proporciona alguna información de palabras clave, pero construir una base de datos global de palabras clave similar a Semrush localmente no es realista para la mayoría de los individuos.

El análisis de backlinks es más pesado en infraestructura. Ahrefs, Semrush, Majestic y empresas similares rastrean continuamente enormes porciones de la web, normalizan URLs, identifican enlaces, deduplican datos y mantienen índices históricos. Un individuo puede rastrear sitios de competencia seleccionados o monitorear enlaces descubiertos a través de Search Console y analíticas, pero eso no es equivalente a una base de datos de backlinks a escala de la web. Los productos de SEO de código abierto integran DataForSEO, Ahrefs u otro proveedor para estas dos categorías porque los datos subyacentes son caros de recopilar.

Una pila completamente autoalojada práctica

Si el objetivo es un SEO útil sin una API de SEO de pago, combina componentes especializados en lugar de buscar una aplicación gigante:

flowchart TD SITE[Website] GSC[Google Search Console] CRAWL[SiteOne] SEO[SEO Skill] SERP[OpenSERP] AGENT[AI Agent] LLM[Local LLM] GIT[Git / CMS] SITE --> CRAWL SITE --> GSC GSC --> SEO CRAWL --> SEO SERP --> SEO SEO --> AGENT AGENT --> LLM AGENT --> GIT

Las responsabilidades:

SiteOne:
  technical crawl
  CI regression checks

SEO Skill:
  Search Console
  first-party opportunity analysis
  MCP

OpenSERP:
  optional SERP observations

Local LLM:
  interpretation and language tasks

Agent:
  workflow orchestration

Git/CMS:
  controlled publication changes

Esta pila no puede reproducir cada función de Ahrefs, pero cubre la mayor parte del trabajo involucrado en mejorar un sitio web existente.

Elección de una herramienta para tu requisito

Requisito principal Herramienta
Comprobaciones técnicas deterministas, uso CI/CD, IA local opcional SiteOne
Rastreador web amigable para humanos con exportaciones y renderizado de JavaScript LibreCrawl
Rastreador nativo de IA: MCP, acceso SQL, interfaz multiusuario, Ollama/vLLM local Scouter
Backend CLI/MCP que combina evidencia de rastreo y Search Console SEO Skill
Panel persistente: GSC, rastreo, Core Web Vitals, acceso de agente CrawlSEO
Panel centrado en Search Console: deterioro, consultas de impacto, acceso de agente OpenGSC
Seguimiento de posiciones de palabras clave, proxies autoadministrados o proveedor de SERP SerpBear
Infraestructura de SERP autoalojada cruda para scripts y agentes OpenSERP
Producto integrado estilo Semrush con DataForSEO debajo OpenSEO

Pilas recomendadas por tipo de sitio web

Blog de WordPress pequeño

Un plugin de SEO de WordPress convencional junto con un rastreo técnico ocasional es suficiente:

The SEO Framework / Yoast / SEOPress
+
SiteOne or LibreCrawl

Hay pocas razones para desplegar cinco servicios para un sitio pequeño.

Publicación de WordPress establecida

WordPress SEO plugin
+
CrawlSEO or SEO Skill
+
Search Console
+
technical crawler

Añade un LLM local solo si tienes suficiente contenido que el análisis automatizado ahorre tiempo significativo.

Sitio técnico estático o Hugo

SiteOne
+
SEO Skill
+
Search Console
+
Git CI

Esto hace que el SEO sea parte del flujo de trabajo de ingeniería.

Entorno autoalojado intensivo en IA

Scouter or SiteOne
+
SEO Skill
+
MCP agent
+
local Ollama / llama.cpp / vLLM
+
Git review workflow

Aquí es donde el autoalojamiento proporciona la mayor libertad arquitectónica.

Conclusión

El ecosistema de SEO de código abierto es lo suficientemente grande como para que “SEO autoalojado” sea una categoría real en lugar de una colección de scripts abandonados. Ninguna aplicación de código abierto única reproduce cada función útil de Ahrefs o Semrush sin datos externos: las bases de datos globales de palabras clave y los índices de backlinks a escala de la web siguen siendo caros porque los datos subyacentes son caros de recopilar.

La oportunidad práctica está en las capas que puedes poseer: rastreo técnico, análisis de Search Console de primera parte, observación local de SERP a escala moderada, interpretación de esa evidencia por LLM local, MCP como interfaz para agentes y CI/CD como puerta de regresión. Para la mayoría de los sitios web técnicamente gestionados, esa combinación es más valiosa que recrear un conjunto comercial, y responde a la pregunta que importa: qué capacidades necesitas, qué datos puedes recopilar tú mismo y dónde un conjunto de datos externo añade realmente valor.

Referencias

Suscribirse

Recibe nuevas publicaciones sobre sistemas, infraestructura e ingeniería de IA.