Crawler de site
Crawlez votre site et découvrez ses pages
Presque personne ne sait combien de pages son site possède réellement. Des orphelines subsistent après une migration, une série paginée s'étire plus loin que dans les souvenirs, une section entière dort derrière un lien que personne n'a mis à jour. Un crawler répond à cette question en parcourant le site comme le ferait un moteur : partir d'une adresse, suivre ce qu'il trouve, et tenir le registre de tout ce qu'il a vu.
D'où viennent les pages trouvées
Cinq sources alimentent la file, et chaque URL découverte garde en mémoire celle qui l'a produite : l'adresse que vous avez soumise, les sitemaps XML — index compris, suivis jusqu'à leurs enfants —, les déclarations du robots.txt, la navigation et le pied de page, et les liens ordinaires trouvés dans les pages déjà lues. Une page joignable par plusieurs de ces voies est une page dont personne n'a à s'inquiéter ; celle qui n'apparaît que dans un sitemap l'est généralement.
L'ordre est décidé, pas subi
Quand un site contient plus d'URL que l'offre n'en autorise, le choix des pages lues compte davantage que leur nombre. Chaque URL reçoit une priorité tirée de faits observables seulement : la profondeur où elle se trouve, l'endroit où le lien a été repéré, son texte d'ancre, le nombre de pages internes distinctes qui pointent vers elle, et la forme de son chemin lorsqu'elle ressemble à une série paginée. Le résultat est reproductible : le même site crawlé deux fois retient les mêmes pages, et la raison de chaque choix peut être énoncée.
Chaque page non lue est nommée, avec son motif
Découvertes, mises en file, récupérées, rendues, analysées, bloquées, défiées et en échec sont comptées séparément, tout comme les URL encore en attente à l'arrêt du parcours. Une page refusée par le robots.txt, retenue derrière une authentification, répondant par un défi anti-robot, arrivant en délai dépassé ou redirigeant hors du site est consignée avec ce motif exact plutôt que discrètement écartée. Un rapport de parcours qui ne montre que ce qui a fonctionné parle d'un autre site que le vôtre.
Les URL sont comparées, pas seulement collectées
Les paramètres de suivi sont retirés avant toute comparaison : une page qui arrive avec une douzaine d'étiquettes de campagne reste une page, pas douze. Les sous-domaines du même domaine enregistrable comptent comme faisant partie du site, ce qui évite qu'une boutique ou une langue hébergée en sous-domaine passe pour le site de quelqu'un d'autre. Le protocole, la variante www, la barre oblique finale et la casse sont ensuite comparés sur tout ce qui a réellement été récupéré.
Crawler ou scanner : lequel vous faut-il
Le crawler répond à « jusqu'où ce site se laisse-t-il parcourir, et quelle part avons-nous atteinte ». Le scanner répond à « de quoi ce site est-il fait » : ressources, images, cookies, traqueurs et technologies que ses pages appellent. L'un dresse la carte du territoire, l'autre inventorie ce qui s'y trouve. La plupart des visiteurs venus chercher une vue complète finissent par lancer les deux, dans cet ordre.
Ce que le parcours rapporte sur l'accessibilité de vos pages
Chacun de ces points est une vérification réelle, et chacune porte sur la possibilité même de trouver et de lire vos pages.
Cohérence de la navigation
Compare la navigation de chaque page parcourue et vérifie que les pages clés y sont liées.
Sitemap XML
Un sitemap XML est publié et lisible.
robots.txt
Un fichier robots.txt est publié.
Plan du site (visiteurs)
Recherche un plan du site lisible par un humain. Ce n'est PAS le sitemap.xml, audité par les contrôles SEO.
Indexabilité
Les pages analysées ne sont pas exclues de l'index par une balise meta robots.
Cohérence des URL
Compare protocole, variante www, barre oblique finale, casse et paramètres sur les URL réellement récupérées.
Réponses en erreur
Les pages parcourues répondent sans erreur serveur.
Couverture des mesures de performance
Quelle part de l'inventaire des ressources a réellement pu être mesurée dans le budget du scan.
Le parcours respecte le robots.txt et s'arrête au budget de pages de votre offre : il lit donc une partie définie de votre site plutôt que sa totalité, et dit laquelle. Il ne se connecte jamais, ne résout aucun CAPTCHA et ne contourne aucune protection anti-robot : une page exigeant une vraie session est rapportée comme non analysée, avec son motif.
Entrez l'adresse de votre site et VeriFixScan l'analyse immédiatement. Sans compte, sans installation, rien à ajouter sur votre site.
Questions fréquentes
- Qu'est-ce qu'un crawler de site web ?
- Un programme qui part d'une adresse, lit la page, suit les liens et les entrées de sitemap qu'il y trouve, puis recommence. C'est ainsi qu'un moteur découvre ce que contient un site, et c'est ainsi que vous apprenez lesquelles de vos pages sont réellement joignables.
- Comment crawler mon propre site ?
- Soumettez votre adresse et le parcours démarre là. Aucun fichier à téléverser, rien à installer : les pages sont lues en HTTP exactement telles qu'elles sont servies à n'importe qui.
- Va-t-il découvrir toutes les pages de mon site ?
- Il découvre ce qui est joignable depuis votre adresse d'entrée, vos sitemaps, votre robots.txt et votre navigation, dans la limite du budget de pages de votre offre. Une page liée de nulle part et absente de tout sitemap ne peut être découverte par aucun crawler, le nôtre compris — et les chiffres de couverture disent jusqu'où le parcours est allé.
- Le crawler suit-il les sitemaps et le robots.txt ?
- Les deux, pour des raisons différentes. Les sitemaps et les déclarations du robots.txt sont lus comme sources d'URL ; les règles du robots.txt sont ensuite respectées, si bien qu'un chemin interdit est consigné comme bloqué au lieu d'être récupéré.
- Explore-t-il les sous-domaines ?
- Les sous-domaines du même domaine enregistrable sont traités comme faisant partie de votre site : une boutique ou une langue hébergée ainsi est suivie plutôt qu'écartée comme externe. Les domaines sans rapport ne sont jamais parcourus.
- Explore-t-il les sites des autres ?
- Il parcourt l'adresse que vous soumettez. Les liens pointant vers d'autres domaines sont vérifiés en tant que liens, donc un lien mort est signalé, mais ces pages ne sont ni parcourues ni analysées.
- Que se passe-t-il quand une page ne peut pas être lue ?
- Le parcours continue immédiatement et note pourquoi : robots.txt interdit, authentification requise, protection anti-robot, 403, 429, délai dépassé, erreur réseau ou redirection hors du site. Le reste de l'analyse est mené à terme et rapporté avec ces pages listées.
- Quelle différence entre crawler et scanner ?
- Crawler, c'est découvrir et atteindre des pages ; scanner, c'est inventorier ce qu'elles contiennent. Cette page traite du premier, le scanner de site du second, et un audit complet exécute les deux sur le même parcours.
- Puis-je crawler mon site gratuitement ?
- Le scan gratuit parcourt un échantillon de votre site sans compte. Un budget de pages plus large, donc un parcours plus profond, vient avec une offre.
