Zum Hauptinhalt springen
Fehlerbehebung6 Min. gelesen

Wenn ein Crawl ins Stocken gerät, fehlschlägt oder Teilergebnisse zurückgibt

Crawls hängen davon ab, dass Ihre Website erreichbar ist, schnell genug reagiert und durch die Robots-Richtlinie zulässig ist. Teilergebnisse bedeuten in der Regel, dass einige URLs abgelaufen sind oder blockiert wurden, während andere erfolgreich waren.

Crawls, Exporte und wenn etwas nicht wie erwartet endet.

Schritte

  1. Öffnen Sie die Jobdetailseite und lesen Sie die Statusmeldung und etwaige Fehlerzusammenfassungen.
  2. Überprüfen Sie, ob die Seed-URL in einem Browser aus einem Netzwerk geladen wird, das dem öffentlichen Internet ähnelt (nicht nur VPN-Unternehmens-Split-Tunnel).
  3. Überprüfen Sie robots.txt und Meta-Robots auf versehentliches Disallow oder Noindex in wichtigen Abschnitten.
  4. Suchen Sie nach Ratenbegrenzung oder Bot-Schutz (WAF, Cloudflare), die automatisierte Clients herausfordern könnten.
  5. Versuchen Sie es mit einem kleineren Bereich (einzelner Pfad oder weniger URLs) erneut, um herauszufinden, ob das Problem global oder abschnittsspezifisch ist.
  6. Wenn die Blockierung weiterhin besteht, wenden Sie sich mit der Job-ID, der ungefähren Zeit und Beispiel-URLs, bei denen ein Fehler aufgetreten ist, an den Support.

Typische Fehler

  • Angenommen, __INSEO__ ist ausgefallen, wenn der Ursprungsserver 5xx zurückgibt oder für jede URL eine Zeitüberschreitung auftritt.
  • Führen Sie aggressive parallele Crawls für einen kleinen gemeinsam genutzten Host aus, der keine Parallelität bewältigen kann.

Häufig gestellte Fragen

Respektiert __INSEO__ robots.txt?

Ja für Standardverhalten beim Webcrawlen. Wenn Sie eine andere Vereinbarung für einen kontrollierten Staging-Host benötigen, besprechen Sie die Optionen mit dem Support.

Verwandte Themen