Rastreador web

Rastrea tu sitio web y descubre sus páginas

Casi nadie sabe cuántas páginas tiene realmente su sitio web. Quedan huérfanas después de una migración, una serie paginada es más larga de lo que nadie recuerda, una sección entera vive detrás de un enlace que nadie actualizó. Un rastreador responde a eso recorriendo el sitio como lo hace un buscador: empieza en una dirección, sigue lo que encuentra y lleva registro de todo lo que vio.

De dónde saca el rastreador tus páginas

Cinco fuentes alimentan la cola, y cada URL descubierta guarda cuál la produjo: la dirección que enviaste, los sitemaps XML (incluidos los índices de sitemap, seguidos hasta sus hijos), las declaraciones del robots.txt, la navegación y el pie del sitio, y los enlaces normales dentro de las páginas ya leídas. Una página alcanzable por varias de esas vías es una página por la que nadie tiene que preocuparse; una que aparece en un sitemap y en ningún otro sitio, normalmente sí.

El orden se decide, no es casual

Cuando un sitio tiene más URLs de las que permite el plan, qué páginas se leen importa más que cuántas. Cada URL recibe una prioridad a partir de hechos observables: la profundidad a la que está, dónde se encontró el enlace, su texto ancla, cuántas páginas internas distintas apuntan a ella y si su ruta parece una serie paginada. El resultado es repetible: el mismo sitio rastreado dos veces elige las mismas páginas, y se puede explicar por qué se eligió cada una.

Cada página que no se leyó se nombra, con su motivo

Descubiertas, en cola, descargadas, renderizadas, analizadas, bloqueadas, desafiadas y fallidas se cuentan por separado, y las URLs que seguían esperando cuando el rastreo terminó también se cuentan. Una página rechazada por el robots.txt, retenida tras un inicio de sesión, respondiendo con un desafío anti-bot, agotando el tiempo o redirigiendo fuera del sitio se registra con ese motivo exacto en vez de descartarse en silencio. Un informe de rastreo que solo muestra lo que funcionó te está hablando de un sitio distinto del tuyo.

Las URLs se comparan, no solo se recogen

Los parámetros de seguimiento se eliminan antes de comparar dos direcciones, así que una página que llega con una docena de etiquetas de campaña es una página y no una docena. Los subdominios del mismo dominio registrable cuentan como parte del sitio, lo que evita que un subdominio de idioma o de tienda se confunda con la web de otra persona. Después se comparan el esquema, la variante www, la barra final y las mayúsculas en todo lo que se descargó de verdad.

Rastreador o escáner: cuál te hace falta

El rastreador responde por dónde se puede recorrer este sitio y hasta dónde llegamos. El escáner responde de qué está hecho: los recursos, las imágenes, las cookies, los rastreadores y las tecnologías que sus páginas cargan. Uno dibuja el mapa del terreno, el otro inventaría lo que hay encima. Casi todo el mundo que llega aquí queriendo una foto completa acaba usando los dos, en ese orden.

Qué informa el rastreo sobre el alcance

Cada una de estas es una comprobación real, y todas hablan de si tus páginas pueden encontrarse y leerse siquiera.

  • Coherencia de la navegación

    Compara la navegación de cada página rastreada y comprueba que las páginas clave estén enlazadas desde ella.

  • Sitemap XML

    Hay un sitemap XML publicado y legible.

  • robots.txt

    Hay un archivo robots.txt publicado.

  • Mapa del sitio HTML (visitantes)

    Busca un mapa del sitio legible por personas. NO es el sitemap.xml, que auditan las comprobaciones de SEO.

  • Indexabilidad

    Las páginas analizadas no están bloqueadas para indexación por una meta robots.

  • Coherencia de URLs

    Compara esquema, variante www, barra final, mayúsculas y parámetros entre las URLs realmente descargadas.

  • Respuestas de error

    Las páginas rastreadas respondieron sin error de servidor.

  • Cobertura de las mediciones de velocidad

    Qué parte del inventario de recursos se pudo medir de verdad dentro del presupuesto del análisis.

El rastreo respeta el robots.txt y se detiene en el límite de páginas de tu plan, así que lee una parte definida de tu sitio en lugar de todo, y dice cuál. Nunca inicia sesión, nunca resuelve un CAPTCHA y nunca rodea una protección anti-bot: una página que necesita una sesión real se informa como no analizada, con el motivo.

Analiza tu sitio gratis

Escribe la dirección de tu sitio y VeriFixScan lo analiza al instante. Sin cuenta, sin instalar nada y sin tocar tu sitio.

Preguntas frecuentes

¿Qué es un rastreador web?
Un programa que empieza en una dirección, lee la página, sigue los enlaces y las entradas de sitemap que encuentra, y repite. Así descubre un buscador lo que contiene un sitio, y así averiguas tú cuáles de tus páginas son realmente alcanzables.
¿Cómo rastreo mi propio sitio web?
Envías tu dirección y el rastreo empieza ahí. No hay archivo que subir ni nada que instalar: las páginas se leen por HTTP exactamente como se sirven a cualquier otra persona.
¿Puede escanear todas las páginas de un sitio web?
Descubre lo que es alcanzable desde tu dirección de entrada, tus sitemaps, tu robots.txt y tu navegación, dentro del límite de páginas de tu plan. Una página que no enlaza nadie y que no aparece en ningún sitemap no puede descubrirla ningún rastreador, tampoco el nuestro, y las cifras de cobertura dicen hasta dónde llegó realmente.
¿El rastreador sigue los sitemaps y el robots.txt?
Los dos, y por motivos distintos. Los sitemaps y las declaraciones del robots.txt se leen como fuentes de URLs; después las reglas del robots.txt se obedecen, así que una ruta no permitida se registra como bloqueada en lugar de descargarse.
¿Rastrea los subdominios?
Los subdominios del mismo dominio registrable se tratan como parte de tu sitio, así que un subdominio de tienda o de idioma se sigue en vez de descartarse como externo. Los dominios ajenos no se rastrean nunca.
¿Rastrea sitios web de otras personas?
Rastrea la dirección que envías. Los enlaces que apuntan a otros dominios se verifican como enlaces, así que uno muerto se informa, pero esas páginas no se rastrean ni se analizan.
¿Qué pasa cuando una página no se puede leer?
El rastreo sigue adelante de inmediato y registra el motivo: robots no permitido, requiere inicio de sesión, protección anti-bot, un 403, un 429, tiempo agotado, un error de red o una redirección fuera del sitio. El resto del análisis se completa y se informa con esas páginas listadas.
¿Cuál es la diferencia entre rastrear y escanear?
Rastrear descubre y alcanza páginas; escanear inventaría lo que esas páginas contienen. Esta página cubre lo primero, el escáner de sitios web cubre lo segundo, y una auditoría completa ejecuta ambos sobre el mismo rastreo.
¿Puedo rastrear mi sitio web gratis?
El análisis gratuito rastrea una muestra de tu sitio sin cuenta. Un límite de páginas mayor, y por tanto un rastreo más profundo, viene con un plan.

Seguir leyendo

Esta página en otros idiomas