Website-Crawler
Crawlen Sie Ihre Website und finden Sie ihre Seiten
Kaum jemand weiß, wie viele Seiten die eigene Website wirklich hat. Nach einer Migration bleiben verwaiste Seiten zurück, eine paginierte Reihe läuft weiter als erinnert, ein ganzer Bereich hängt an einem Link, den niemand aktualisiert hat. Ein Crawler beantwortet das, indem er die Website durchläuft wie eine Suchmaschine: bei einer Adresse beginnen, dem folgen, was er findet, und über alles Gesehene Buch führen.
Woher der Crawler Ihre Seiten kennt
Fünf Quellen speisen die Warteschlange, und jede gefundene URL merkt sich, welche sie hervorgebracht hat: die eingereichte Adresse, die XML-Sitemaps samt Indexdateien bis hinunter zu ihren Kindern, die Angaben der robots.txt, Navigation und Fußbereich sowie gewöhnliche Links in den bereits gelesenen Seiten. Eine über mehrere dieser Wege erreichbare Seite macht niemandem Sorgen; eine, die nur in einer Sitemap auftaucht, meistens schon.
Die Reihenfolge ist entschieden, nicht zufällig
Hat eine Website mehr URLs, als der Tarif zulässt, zählt die Auswahl der gelesenen Seiten mehr als deren Anzahl. Jede URL erhält eine Priorität allein aus beobachtbaren Tatsachen: der Tiefe, in der sie liegt, dem Fundort des Links, seinem Ankertext, der Zahl verschiedener interner Seiten, die auf sie zeigen, und der Form ihres Pfades, wenn er nach einer paginierten Reihe aussieht. Das Ergebnis ist wiederholbar: Dieselbe Website zweimal gecrawlt liefert dieselben Seiten, und der Grund jeder Auswahl lässt sich benennen.
Jede ungelesene Seite wird benannt, mitsamt Grund
Gefunden, eingereiht, abgerufen, gerendert, analysiert, blockiert, herausgefordert und gescheitert werden getrennt gezählt, ebenso die beim Abbruch noch wartenden URLs. Eine von der robots.txt abgelehnte Seite, eine hinter einer Anmeldung, eine mit Bot-Abfrage, eine mit Zeitüberschreitung oder eine Weiterleitung nach außen erscheint mit genau diesem Grund statt still zu verschwinden. Ein Crawl-Bericht, der nur zeigt, was geklappt hat, spricht über eine andere Website als Ihre.
URLs werden verglichen, nicht bloß gesammelt
Tracking-Parameter fallen weg, bevor zwei Adressen verglichen werden: Eine Seite, die mit einem Dutzend Kampagnen-Anhängseln ankommt, bleibt eine Seite und wird nicht zwölf. Subdomains derselben registrierbaren Domain zählen zur Website, damit eine Shop- oder Sprach-Subdomain nicht für die Website eines Fremden gehalten wird. Schema, www-Variante, abschließender Schrägstrich und Groß- und Kleinschreibung werden anschließend über alles wirklich Abgerufene verglichen.
Crawler oder Scanner: was Sie brauchen
Der Crawler beantwortet, wie weit sich diese Website durchlaufen lässt und welchen Teil davon wir erreicht haben. Der Scanner beantwortet, woraus diese Website besteht: Ressourcen, Bilder, Cookies, Tracker und Technologien, die ihre Seiten laden. Der eine kartiert das Gelände, der andere erfasst, was darauf steht. Wer ein vollständiges Bild sucht, lässt am Ende meist beide laufen, in dieser Reihenfolge.
Was der Crawl über die Erreichbarkeit meldet
Jeder dieser Punkte ist eine echte Prüfung, und jede betrifft die Frage, ob Ihre Seiten überhaupt auffindbar und lesbar sind.
Navigationskohärenz
Vergleicht die Navigation jeder gecrawlten Seite und prüft, ob Schlüsselseiten darin verlinkt sind.
XML-Sitemap
Eine XML-Sitemap ist veröffentlicht und lesbar.
robots.txt
Eine robots.txt ist veröffentlicht.
Sitemap für Besucher
Sucht eine für Menschen lesbare Sitemap-Seite. Das ist NICHT die sitemap.xml, die von den SEO-Prüfungen auditiert wird.
Indexierbarkeit
Analysierte Seiten werden nicht durch ein Robots-Meta-Tag vom Index ausgeschlossen.
URL-Konsistenz
Vergleicht Schema, www-Variante, abschließenden Schrägstrich, Groß- und Kleinschreibung sowie Parameter über die tatsächlich abgerufenen URLs.
Fehlerantworten
Gecrawlte Seiten antworteten ohne Serverfehler.
Abdeckung der Performance-Messung
Wie viel des Ressourceninventars im Rahmen des Scan-Budgets wirklich gemessen werden konnte.
Der Crawl beachtet die robots.txt und endet am Seitenbudget Ihres Tarifs: Er liest also einen bestimmten Teil Ihrer Website statt der ganzen — und sagt, welchen. Er meldet sich nie an, löst kein CAPTCHA und umgeht keinen Bot-Schutz: Eine Seite, die eine echte Sitzung verlangt, erscheint als nicht analysiert, mit Grund.
Geben Sie Ihre Website-Adresse ein, und VeriFixScan prüft sie sofort. Ohne Konto, ohne Installation, ohne Änderung an Ihrer Website.
Häufige Fragen
- Was ist ein Website-Crawler?
- Ein Programm, das bei einer Adresse beginnt, die Seite liest, den dort gefundenen Links und Sitemap-Einträgen folgt und von vorn anfängt. So entdeckt eine Suchmaschine, was eine Website enthält, und so erfahren Sie, welche Ihrer Seiten tatsächlich erreichbar sind.
- Wie crawle ich meine eigene Website?
- Reichen Sie Ihre Adresse ein, dort beginnt der Durchlauf. Keine Datei hochzuladen, nichts zu installieren: Die Seiten werden über HTTP gelesen, genau so, wie sie jedem anderen ausgeliefert werden.
- Findet er wirklich jede Seite meiner Website?
- Er findet, was von Ihrer Einstiegsadresse, Ihren Sitemaps, Ihrer robots.txt und Ihrer Navigation aus erreichbar ist, im Rahmen des Seitenbudgets Ihres Tarifs. Eine Seite, auf die nirgends verlinkt wird und die in keiner Sitemap steht, kann kein Crawler finden, unserer eingeschlossen — und die Abdeckungszahlen sagen, wie weit der Durchlauf kam.
- Folgt der Crawler Sitemaps und robots.txt?
- Beiden, aus verschiedenen Gründen. Sitemaps und robots.txt-Angaben dienen als URL-Quellen; die Regeln der robots.txt werden anschließend befolgt, sodass ein gesperrter Pfad als blockiert vermerkt statt abgerufen wird.
- Werden Subdomains mitgecrawlt?
- Subdomains derselben registrierbaren Domain gelten als Teil Ihrer Website, eine Shop- oder Sprach-Subdomain wird also verfolgt statt als extern verworfen. Fremde Domains werden nie gecrawlt.
- Crawlt er auch fremde Websites?
- Er durchläuft die Adresse, die Sie einreichen. Links auf andere Domains werden als Links geprüft, ein toter Link erscheint also im Bericht, doch jene Seiten werden weder durchlaufen noch analysiert.
- Was geschieht, wenn eine Seite nicht gelesen werden kann?
- Der Durchlauf geht sofort weiter und hält den Grund fest: robots.txt gesperrt, Anmeldung nötig, Bot-Schutz, ein 403, ein 429, Zeitüberschreitung, Netzwerkfehler oder Weiterleitung nach außen. Die übrige Analyse wird zu Ende geführt und mit diesen Seiten aufgeführt.
- Worin unterscheiden sich Crawlen und Scannen?
- Crawlen entdeckt und erreicht Seiten; Scannen erfasst, was diese Seiten enthalten. Diese Seite behandelt das Erste, der Website-Scanner das Zweite, und ein vollständiges Audit führt beides auf demselben Durchlauf aus.
- Kann ich meine Website kostenlos crawlen?
- Der kostenlose Scan durchläuft eine Stichprobe Ihrer Website ohne Konto. Ein größeres Seitenbudget und damit ein tieferer Durchlauf kommt mit einem Tarif.
