Fehlerbehebung6 Min. gelesen
Wenn ein Crawl ins Stocken gerät, fehlschlägt oder Teilergebnisse zurückgibt
Crawls hängen davon ab, dass Ihre Website erreichbar ist, schnell genug reagiert und durch die Robots-Richtlinie zulässig ist. Teilergebnisse bedeuten in der Regel, dass einige URLs abgelaufen sind oder blockiert wurden, während andere erfolgreich waren.
Crawls, Exporte und wenn etwas nicht wie erwartet endet.
Schritte
- Öffnen Sie die Jobdetailseite und lesen Sie die Statusmeldung und etwaige Fehlerzusammenfassungen.
- Überprüfen Sie, ob die Seed-URL in einem Browser aus einem Netzwerk geladen wird, das dem öffentlichen Internet ähnelt (nicht nur VPN-Unternehmens-Split-Tunnel).
- Überprüfen Sie robots.txt und Meta-Robots auf versehentliches Disallow oder Noindex in wichtigen Abschnitten.
- Suchen Sie nach Ratenbegrenzung oder Bot-Schutz (WAF, Cloudflare), die automatisierte Clients herausfordern könnten.
- Versuchen Sie es mit einem kleineren Bereich (einzelner Pfad oder weniger URLs) erneut, um herauszufinden, ob das Problem global oder abschnittsspezifisch ist.
- Wenn die Blockierung weiterhin besteht, wenden Sie sich mit der Job-ID, der ungefähren Zeit und Beispiel-URLs, bei denen ein Fehler aufgetreten ist, an den Support.
Typische Fehler
- Angenommen, __INSEO__ ist ausgefallen, wenn der Ursprungsserver 5xx zurückgibt oder für jede URL eine Zeitüberschreitung auftritt.
- Führen Sie aggressive parallele Crawls für einen kleinen gemeinsam genutzten Host aus, der keine Parallelität bewältigen kann.
Häufig gestellte Fragen
Respektiert __INSEO__ robots.txt?
Ja für Standardverhalten beim Webcrawlen. Wenn Sie eine andere Vereinbarung für einen kontrollierten Staging-Host benötigen, besprechen Sie die Optionen mit dem Support.