Sitemap: errores que impiden indexar tus páginas

Detecta los errores de sitemap que dejan páginas fuera de Google: robots.txt, 404, noindex, canónicas y límites de tamaño. Cómo revisarlos en Search Console.

Equipo editorial de ADS BeastPublicado 11 min de lectura

Un sitemap no indexa nada por sí solo. Es una lista que le dice a Google qué URLs existen, y si esa lista tiene errores, Google descarta entradas sin avisarte. Los fallos más frecuentes son URLs bloqueadas en robots.txt, enlaces que devuelven 404 o 500, etiquetas noindex en las páginas listadas y archivos que superan los 50.000 URLs o los 50 MB sin comprimir.

En resumen

  • Estar en el sitemap es una sugerencia, no una orden de indexación.
  • Google puede leer tu sitemap correctamente y aun así no indexar todas las URLs.
  • Un estado "Correcto" en Search Console solo confirma la lectura del archivo.
  • Los errores más graves (robots.txt, noindex, 404) se detectan cruzando Sitemaps con Cobertura.
  • Un solo archivo admite hasta 50.000 URLs y 50 MB sin comprimir; por encima, necesitas un índice.

Qué es un sitemap y qué no puede hacer por ti

Un sitemap es un archivo XML que enumera las URLs de un sitio para que los motores de búsqueda las rastreen. El formato estándar se conoce como sitemap xml, y su versión más habitual es sitemap.xml en la raíz del dominio.

Lo que no hace: no fuerza la indexación, no mejora el ranking y no sustituye a una estructura de enlaces internos sana. Si una página tiene contenido duplicado, está bloqueada o responde con error, aparecer en el sitemap no cambia nada. Google la rastreará, verá el problema y la dejará fuera.

Por eso conviene entender el sitemap como una declaración de intenciones: "estas son mis URLs importantes". Google decide después si las indexa.

Revisión de errores en el sitemap. Robots.txt: URLs del sitemap bloqueadas con Disallow; Errores 404 y 500: Enlaces muertos o servidor inestable; Etiquetas noindex: Señal contradictoria con el sitemap; Límites de tamaño: Más de 50.000 URLs o 50 MB por archivo; Canónicas y ubicación: Canonical confli
Los seis fallos que dejan páginas fuera del índice de Google

Los 6 errores de sitemap que dejan páginas fuera de Google

Estos son los fallos que aparecen una y otra vez en auditorías, ordenados por frecuencia y por daño que causan.

1. URLs bloqueadas en robots.txt

Si una URL está en el sitemap pero bloqueada en robots.txt, Google no la rastrea. El sitemap la menciona, el robot la rechaza, y el resultado es una entrada inútil.

El error típico surge al bloquear carpetas enteras por motivos de rendimiento (por ejemplo, /buscar/ o /carrito/) sin revisar si alguna URL útil vive dentro. Otro caso frecuente: bloquear todo el sitio en un entorno de pruebas y olvidar quitar la regla al pasar a producción.

Para comprobarlo, abre robots.txt y busca la línea Disallow: que afecte a la URL. Si aparece, el sitemap no sirve de nada para esa página.

2. Enlaces que devuelven 404 o 500

Una URL en el sitemap que devuelve 404 es una URL muerta. Google la rastreará, encontrará el error y la marcará como excluida. Si el sitemap se genera automáticamente, es habitual que siga incluyendo páginas borradas durante semanas.

Los errores 500 son peores. Un servidor que falla de forma intermitente hace que Google reduzca la frecuencia de rastreo del archivo completo. No es que ignore una URL: deja de confiar en el sitemap.

Revisa el informe de Cobertura y filtra por "No encontrada (404)" y "Error de servidor (5xx)". Si aparecen URLs que también están en el sitemap, tienes trabajo pendiente.

3. Etiquetas noindex en páginas listadas

Una página con <meta name="robots" content="noindex"> le dice a Google que no la indexe. Si además está en el sitemap, estás enviando dos señales contradictorias.

Esto pasa mucho en tiendas online con páginas de filtros o variantes de producto, y en blogs con páginas de autor o etiquetas que se marcaron como noindex pero siguen en el sitemap. La solución es excluirlas del archivo o quitar el noindex, según lo que quieras.

4. Superar los límites de tamaño del archivo

Un sitemap individual admite hasta 50.000 URLs y 50 MB sin comprimir. Por encima de esos límites, Google rechaza el archivo o lo lee parcialmente.

La solución es un índice de sitemaps: un archivo que apunta a varios sitemaps más pequeños. Es lo habitual en sitios con muchos productos, varios idiomas o subdominios. Si tienes 80.000 URLs y un solo sitemap, estás perdiendo las 30.000 últimas sin saberlo.

5. URLs canónicas mal configuradas

Si una URL del sitemap tiene una etiqueta canonical que apunta a otra página, Google indexará la canónica, no la del sitemap. Esto no es un error en sí, pero sí lo es cuando la canónica apunta a una URL que no quieres posicionar, o cuando hay cadenas de canónicas que se contradicen.

El síntoma en Search Console: la URL aparece como "Excluida" con el motivo "Duplicada, Google eligió una canónica distinta". Si eso ocurre en páginas que sí quieres indexar, revisa las etiquetas.

6. Sitemap no declarado o mal ubicado

Un sitemap que Google no encuentra no existe. La ruta estándar es la raíz del dominio, por ejemplo tudominio.com/sitemap.xml, y debe declararse en robots.txt con la línea Sitemap:.

Si usas un subdirectorio, el archivo solo puede incluir URLs de ese directorio. Un sitemap en /tienda/sitemap.xml que liste páginas del blog no se procesará correctamente.

Cómo revisar tu sitemap paso a paso

Este es el proceso que sigo en una auditoría técnica. Tarda menos de lo que parece y detecta la mayoría de los problemas.

  1. Abre Search Console y entra en la sección Sitemaps. Comprueba el estado y la fecha de la última lectura.
  2. Verifica que el sitemap esté declarado en robots.txt y accesible sin errores.
  3. Abre el informe de Cobertura (o Indexación de páginas) y filtra por "Excluidas".
  4. Cruza las URLs excluidas con las del sitemap. Las que aparezcan en ambos listados son tus candidatas a corregir.
  5. Revisa el código fuente de esas URLs: busca noindex, canonical y el código de respuesta HTTP.
  6. Comprueba en robots.txt si alguna de esas URLs está bloqueada.
  7. Corrige, regenera el sitemap y vuelve a enviarlo. No esperes cambios inmediatos.

Si el sitio es WordPress, el sitemap xml wordpress lo genera un plugin como Yoast o Rank Math. En ese caso, revisa la configuración del plugin: qué tipos de contenido incluye, qué taxonomías excluye y si está añadiendo páginas que no deberían estar. El wp sitemap hereda los errores de configuración del plugin, no los crea por sí solo.

Para verificar el formato antes de enviarlo, puedes usar un validador de sitemap xml ejemplo o comparar tu archivo con un ejemplo de sitemap bien construido. Un sitemap site correcto tiene URLs absolutas, fechas en formato W3C y no incluye páginas bloqueadas.

Auditoría del sitemap en Search Console. Estado del sitemap: Comprueba lectura y fecha en la sección Sitemaps; Informe de Cobertura: Filtra por Excluidas y cuenta las URLs fuera; Cruce de listados: Compara excluidas con las URLs del sitemap; Código de la página: Revisa noindex, canonical y respuesta
Secuencia para detectar qué URLs quedan excluidas y por qué

Errores de sitemap vs. errores de indexación: cómo distinguirlos

No todo lo que impide indexar está en el sitemap. Esta tabla ayuda a separar responsabilidades.

Síntoma en Search ConsoleCausa probable¿Está en el sitemap?
"Bloqueada por robots.txt"Regla Disallow en robots.txtSí, si la URL está listada
"No encontrada (404)"Página eliminada o URL mal generadaSí, si el sitemap no se regeneró
"Excluida por etiqueta noindex"Meta robots noindex en la páginaSí, si no se filtró
"Duplicada, Google eligió otra canónica"Canonical mal configuradaSí, con canonical conflictiva
"Rastreada, actualmente no indexada"Contenido thin o baja calidadIndiferente: es decisión de Google
"Descubierta, actualmente no indexada"Problema de rastreo o presupuestoPuede estar listada sin problema

La diferencia clave: los cuatro primeros son errores técnicos que puedes corregir. Los dos últimos son decisiones de Google sobre la calidad o la prioridad del contenido, y el sitemap no influye en ellas.

Cuánto tarda Google en indexar las páginas de un sitemap

No hay un plazo fijo. En sitios con buena autoridad y rastreo frecuente, lo habitual es que las páginas nuevas aparezcan entre unos días y un par de semanas desde el envío. En sitios nuevos o con poco tráfico, puede tardar más.

Si pasan más de 30 días sin que aparezcan, revisa si el sitemap tiene errores de formato o si las URLs están canónicamente mal configuradas. Search Console muestra la fecha de la última lectura del archivo, y esa fecha te dice si Google lo está revisando con regularidad o lo ha abandonado.

Un dato útil: si el sitemap se lee pero las páginas no se indexan, el problema no está en el archivo. Está en las páginas.

Cómo saber si tu sitemap tiene errores de indexación

Entra en Search Console, sección Sitemaps, y comprueba el estado. "Correcto" significa que Google leyó el archivo sin errores de formato, pero no que haya indexado todo lo que contiene.

El cruce con el informe de Cobertura es lo que da la respuesta real. Un porcentaje alto de URLs "Excluidas" respecto al total del sitemap suele señalar problemas en el propio archivo o en las páginas que lista.

Si trabajas con un equipo de marketing o una agencia, este diagnóstico encaja con una auditoría de cuenta publicitaria en 30 minutos: qué revisar, porque los errores de indexación también distorsionan los datos de campañas. Una página que no se indexa no recibe tráfico orgánico, y si además está en un anuncio, el panel mostrará clics sin conversiones que no cuadran con el CRM.

Errores de sitemap que afectan a la medición y a las campañas

Un sitemap mal configurado no solo afecta al SEO. También rompe la medición.

Si una landing page no se indexa pero recibe tráfico de pago, el equipo de marketing puede creer que la página funciona cuando en realidad solo la ven quienes hacen clic en el anuncio. Cuando se compara el panel de anuncios con el CRM, los números no cuadran, y la causa suele estar en la capa de atribución, no en la página. Ese desajuste lo explico en panel de anuncios vs CRM: por qué no coinciden.

Algo parecido ocurre con el etiquetado. Si las URLs del sitemap no coinciden con las URLs etiquetadas, el seguimiento se rompe. Un etiquetado UTM hasta la ficha del CRM: guía práctica evita que una página indexada y una página etiquetada apunten a destinos distintos.

Y si además usas IA para monitorizar cómo aparece tu marca, conviene saber qué dicen las respuestas de IA sobre la empresa y cómo verificarlo, porque los asistentes se alimentan de páginas indexadas. Lo que no está en el índice, tampoco está en sus respuestas.

Cómo evitar estos errores desde el principio

La prevención es más barata que la corrección. Estas prácticas reducen la mayoría de los fallos.

  • Genera el sitemap automáticamente y regenera al publicar o eliminar contenido.
  • Excluye del sitemap las páginas con noindex, las de filtros y las de búsqueda interna.
  • Declara el sitemap en robots.txt y verifica la ruta.
  • Divide en varios archivos si superas los 50.000 URLs.
  • Revisa el informe de Cobertura una vez al mes, no una vez al año.
  • Usa una herramienta de rastreo para detectar 404 y 500 antes de que Google los vea.

Si gestionas campañas, el sitemap forma parte de la configuración base de una agencia Google Ads: cómo crear y configurar tu cuenta, porque una cuenta bien montada necesita landings indexables y medibles.

Siguiente paso

Abre Search Console, entra en Sitemaps y anota la fecha de la última lectura. Después ve a Cobertura y cuenta cuántas URLs están excluidas. Si el número te sorprende, revisa la configuración técnica de tu sitemap y corrige los bloqueos antes de tocar nada más. Puedes empezar por la guía de sitemap para ver cómo se estructura un archivo correcto y qué revisar en cada envío.

FAQ

¿Qué errores en el sitemap impiden que Google indexe las páginas?

Los fallos más comunes son URLs bloqueadas en robots.txt, enlaces que devuelven errores 404 o 500, y etiquetas noindex en las páginas listadas. También rompe la indexación superar los 50.000 URLs o los 50 MB sin comprimir en un solo archivo. Google descarta esas entradas sin avisar en Search Console.

¿Cuánto tarda Google en indexar las páginas de un sitemap?

No hay un plazo fijo, pero en sitios con buena autoridad suele tardar entre 3 días y 2 semanas desde el envío. Si pasan más de 30 días sin aparecer, revisa si el sitemap tiene errores de formato o si las URLs están canónicamente mal configuradas. Search Console muestra la fecha de la última lectura del archivo.

¿Cómo saber si mi sitemap tiene errores de indexación?

Entra en Search Console, sección Sitemaps, y comprueba el estado: "Correcto" significa que Google lo leyó, pero no que haya indexado todo. Cruza esa lista con el informe de Cobertura para ver cuántas URLs quedan fuera y por qué. Un porcentaje alto de "Excluidas" suele señalar problemas en el propio archivo.

¿Dónde debe estar ubicado el sitemap para que Google lo encuentre?

La ruta estándar es la raíz del dominio, por ejemplo tudominio.com/sitemap.xml, y debe declararse en robots.txt con la línea Sitemap:. Si usas un subdirectorio, el archivo solo puede incluir URLs de ese directorio. Para sitios con varios idiomas o subdominios, lo habitual es un índice de sitemaps que agrupe varios archivos.

¿Por qué Google no indexa páginas que sí aparecen en el sitemap?

Estar en el sitemap es una sugerencia, no una orden. Google puede ignorar URLs con contenido duplicado, thin content, canónicas apuntando a otra página o bloqueos en robots.txt. Revisa también si el servidor responde con códigos 5xx de forma intermitente: eso hace que Google deje de rastrear el archivo.