वेबसाइट क्रॉलर
अपनी वेबसाइट क्रॉल करें और उसके पेज खोजें
लगभग किसी को नहीं पता होता कि उसकी वेबसाइट में असल में कितने पेज हैं। माइग्रेशन के बाद अनाथ पेज पड़े रह जाते हैं, पेजिनेशन की एक शृंखला याद से कहीं लंबी निकलती है, और एक पूरा हिस्सा ऐसे लिंक के पीछे बैठा रहता है जिसे किसी ने अपडेट नहीं किया। एक क्रॉलर इसका जवाब साइट पर उसी तरह चलकर देता है जैसे कोई सर्च इंजन चलता है — एक पते से शुरू करो, जो मिले उसका पीछा करो, और जो कुछ देखा उसका हिसाब रखो।
क्रॉलर आपके पेज कहाँ से पाता है
क़तार को पाँच स्रोत भरते हैं, और हर खोजा गया URL यह दर्ज करता है कि उसे किसने जन्म दिया: वह पता जो आपने दिया, XML साइटमैप (साइटमैप इंडेक्स फ़ाइलें भी, उनके बच्चों तक पीछा करके), robots.txt की घोषणाएँ, साइट का नेविगेशन और फ़ुटर, और पहले से पढ़े जा चुके पेजों के भीतर के साधारण लिंक। जिस पेज तक इनमें से कई रास्तों से पहुँचा जा सकता है, उसकी चिंता किसी को नहीं करनी पड़ती; जो सिर्फ़ एक साइटमैप में दिखता है और कहीं नहीं, उसकी अक्सर करनी पड़ती है।
क्रम तय किया जाता है, संयोग से नहीं बनता
जब किसी साइट में प्लान की अनुमति से ज़्यादा URL होते हैं, तो कितने पेज पढ़े गए इससे ज़्यादा मायने यह रखता है कि कौन-से पढ़े गए। हर URL को सिर्फ़ देखे जा सकने वाले तथ्यों से एक प्राथमिकता दी जाती है — वह किस गहराई पर है, लिंक कहाँ मिला, उसका ऐंकर टेक्स्ट क्या है, कितने अलग आंतरिक पेज उसकी ओर इशारा करते हैं, और उसका रास्ता पेजिनेशन की शृंखला जैसा दिखता है या नहीं। नतीजा दोहराया जा सकता है: वही साइट दो बार क्रॉल करने पर वही पेज चुने जाते हैं, और हर पेज के चुने जाने का कारण बताया जा सकता है।
जो पेज नहीं पढ़ा गया उसका नाम भी है और कारण भी
खोजे गए, क़तार में लगे, लाए गए, रेंडर किए गए, विश्लेषित, रोके गए, चुनौती दिए गए और विफल — सब अलग-अलग गिने जाते हैं, और क्रॉल रुकने के समय जो URL अब भी इंतज़ार में थे वे भी गिने जाते हैं। robots.txt से मना किया गया, लॉगिन के पीछे रखा गया, बॉट चुनौती से जवाब देने वाला, टाइम आउट होने वाला या साइट से बाहर भेजने वाला पेज उसी सटीक कारण के साथ दर्ज होता है, चुपचाप गिरा नहीं दिया जाता। जो क्रॉल रिपोर्ट सिर्फ़ वही दिखाती है जो चला, वह आपको किसी और वेबसाइट के बारे में बता रही है।
URL सिर्फ़ इकट्ठे नहीं होते, उनकी तुलना होती है
दो पतों की तुलना से पहले ट्रैकिंग पैरामीटर हटा दिए जाते हैं, ताकि एक दर्जन कैंपेन टैग के साथ आने वाला एक पेज एक ही पेज रहे, एक दर्जन नहीं। एक ही रजिस्ट्रेबल डोमेन के सबडोमेन साइट का हिस्सा गिने जाते हैं, जिससे किसी भाषा या दुकान वाले सबडोमेन को किसी और की वेबसाइट समझ लेने की ग़लती नहीं होती। इसके बाद जो कुछ वाक़ई लाया गया, उस सब में स्कीम, www वाला रूप, आख़िरी स्लैश और अक्षरों का केस मिलाकर देखा जाता है।
क्रॉलर या स्कैनर: आपको कौन-सा चाहिए
क्रॉलर इसका जवाब देता है कि इस साइट पर कहाँ तक चला जा सकता है, और हम उसका कितना हिस्सा पढ़ पाए। स्कैनर इसका जवाब देता है कि यह साइट बनी किन चीज़ों से है — वे रिसोर्स, इमेज, कुकीज़, ट्रैकर और तकनीकें जो उसके पेज खींचते हैं। एक इलाक़े का नक़्शा बनाता है, दूसरा उस पर खड़ी चीज़ों की सूची। पूरी तस्वीर चाहने वाले ज़्यादातर लोग आख़िर में दोनों चलाते हैं, इसी क्रम में।
पहुँच के बारे में क्रॉल क्या बताता है
इनमें से हर एक असली जाँच है, और हर एक इस बात से जुड़ी है कि आपके पेज खोजे और पढ़े भी जा सकते हैं या नहीं।
नेविगेशन की संगति
हर क्रॉल किए गए पेज के नेविगेशन की तुलना करता है और देखता है कि मुख्य पेज उससे लिंक हैं या नहीं।
XML साइटमैप
एक XML साइटमैप प्रकाशित है और पढ़ा जा सकता है।
robots.txt
एक robots.txt फ़ाइल प्रकाशित है।
HTML साइटमैप (विज़िटर के लिए)
इंसानों के पढ़ने लायक़ साइटमैप पेज खोजता है। यह sitemap.xml नहीं है, जिसका ऑडिट SEO जाँचें करती हैं।
इंडेक्स होने की क्षमता
विश्लेषित पेजों को robots मेटा टैग से इंडेक्सिंग के लिए रोका नहीं गया है।
URL की एकरूपता
वाक़ई लाए गए URL में स्कीम, www वाला रूप, आख़िरी स्लैश, केस और पैरामीटर की तुलना करता है।
एरर प्रतिक्रियाएँ
क्रॉल किए गए पेजों ने बिना सर्वर एरर के जवाब दिया।
परफ़ॉर्मेंस माप की कवरेज
स्कैन की सीमा के भीतर रिसोर्स सूची का कितना हिस्सा वाक़ई मापा जा सका।
क्रॉल robots.txt का पालन करता है और आपके प्लान की पेज सीमा पर रुक जाता है, इसलिए वह आपकी साइट का पूरा हिस्सा नहीं बल्कि एक तय हिस्सा पढ़ता है — और बताता है कि कौन-सा। वह कभी साइन इन नहीं करता, कभी कोई CAPTCHA हल नहीं करता और कभी बॉट सुरक्षा से बचकर नहीं निकलता: जिस पेज के लिए असली सत्र चाहिए, उसे कारण सहित 'विश्लेषित नहीं' बताया जाता है।
अपनी वेबसाइट का पता डालिए और VeriFixScan उसका तुरंत विश्लेषण करता है। न अकाउंट, न इंस्टॉलेशन, आपकी साइट पर कुछ जोड़ने की ज़रूरत नहीं।
अक्सर पूछे जाने वाले सवाल
- वेबसाइट क्रॉलर क्या होता है?
- एक ऐसा प्रोग्राम जो एक पते से शुरू होता है, पेज पढ़ता है, वहाँ मिले लिंक और साइटमैप प्रविष्टियों का पीछा करता है, और यही दोहराता रहता है। इसी तरह कोई सर्च इंजन जानता है कि साइट में क्या है, और इसी तरह आपको पता चलता है कि आपके कौन-से पेज असल में पहुँच योग्य हैं।
- मैं अपनी ही वेबसाइट कैसे क्रॉल करूँ?
- अपना पता दीजिए और क्रॉल वहीं से शुरू हो जाता है। न कोई फ़ाइल अपलोड करनी है, न कुछ इंस्टॉल करना है: पेज HTTP पर ठीक वैसे ही पढ़े जाते हैं जैसे वे किसी और को परोसे जाते हैं।
- क्या यह मेरी वेबसाइट का हर पेज खोज लेगा?
- यह वही खोजता है जिस तक आपके प्रवेश पते, आपके साइटमैप, आपकी robots.txt और आपके नेविगेशन से पहुँचा जा सकता है, और वह भी आपके प्लान की पेज सीमा के भीतर। जिस पेज का कहीं से लिंक नहीं है और जो किसी साइटमैप में नहीं है, उसे कोई भी क्रॉलर नहीं खोज सकता, हमारा भी नहीं — और कवरेज के आँकड़े बताते हैं कि क्रॉल असल में कहाँ तक पहुँचा।
- क्या क्रॉलर साइटमैप और robots.txt का पालन करता है?
- दोनों का, और अलग-अलग कारणों से। साइटमैप और robots.txt की घोषणाएँ URL के स्रोत के रूप में पढ़ी जाती हैं; उसके बाद robots.txt के नियम माने जाते हैं, इसलिए मना किया गया रास्ता लाया नहीं जाता बल्कि 'रोका गया' दर्ज होता है।
- क्या यह सबडोमेन तक जाता है?
- एक ही रजिस्ट्रेबल डोमेन के सबडोमेन आपकी साइट का हिस्सा माने जाते हैं, इसलिए किसी दुकान या भाषा वाले सबडोमेन को बाहरी मानकर छोड़ने के बजाय उसका पीछा किया जाता है। असंबंधित डोमेन कभी नहीं पढ़े जाते।
- क्या यह दूसरों की वेबसाइटों तक जाता है?
- यह उसी पते तक जाता है जो आप देते हैं। दूसरे डोमेन की ओर इशारा करने वाले लिंक की जाँच लिंक के रूप में होती है, ताकि कोई मरा हुआ लिंक बताया जा सके, पर वे पेज न पढ़े जाते हैं और न उनका विश्लेषण होता है।
- जब कोई पेज पढ़ा न जा सके तो क्या होता है?
- क्रॉल तुरंत आगे बढ़ जाता है और कारण दर्ज कर लेता है: robots ने मना किया, लॉगिन चाहिए, बॉट सुरक्षा, एक 403, एक 429, टाइमआउट, नेटवर्क एरर या साइट से बाहर का रीडायरेक्ट। बाक़ी विश्लेषण पूरा होता है और उन पेजों की सूची के साथ बताया जाता है।
- क्रॉल करने और स्कैन करने में क्या अंतर है?
- क्रॉल करना पेज खोजता है और उन तक पहुँचता है; स्कैन करना उन पेजों की सामग्री की सूची बनाता है। यह पेज पहली बात को देखता है, वेबसाइट स्कैनर दूसरी को, और पूरा ऑडिट उसी एक क्रॉल पर दोनों चलाता है।
- क्या मैं अपनी वेबसाइट मुफ़्त में क्रॉल कर सकता हूँ?
- मुफ़्त स्कैन बिना अकाउंट के आपकी साइट के एक नमूने तक जाता है। बड़ी पेज सीमा, और इसलिए गहरा क्रॉल, किसी प्लान के साथ आता है।
