Crawler
Ein Crawler (auch Webcrawler) ist ein Programm, das das Web automatisch durchsucht und sich von Link zu Link hangelt, um Seiten zu entdecken und ihren Inhalt zu lesen. Er ist der erste Schritt in der Funktionsweise einer Suchmaschine: Bevor Google eine Seite in den Ergebnissen zeigen kann, muss es sie mit seinem Crawler, dem Googlebot, finden und crawlen. Was der Crawler einsammelt, geht anschließend in die Indexierung Die Indexierung ist der Vorgang, bei dem eine Suchmaschine eine Seite nach dem Crawlen in ihrem Index speichert, damit sie in den Suchergebnissen erscheinen kann. Mehr im Glossar → . Sein Verhalten steuerst du mit der Datei robots.txt, die festlegt, welche Bereiche er besuchen darf, sowie mit internen Links, die ihm helfen, alle Seiten zu erreichen. Da jede Website ein begrenztes Crawl-Budget hat, lohnt es sich, ihm die Arbeit mit einer klaren Struktur, einer Sitemap Eine Sitemap ist eine Datei, die die wichtigen Seiten deiner Website auflistet, damit Suchmaschinen sie leichter finden und crawlen können. Mehr im Glossar → und dem Vermeiden doppelter oder wertloser Seiten zu erleichtern.