Crawler

Een crawler (of webcrawler) is een programma dat het web automatisch doorloopt, van link naar link springt om pagina’s te ontdekken en hun inhoud te lezen. Het is de eerste stap in de werking van een zoekmachine: voordat Google een pagina in de resultaten kan tonen, moet het die vinden en crawlen met zijn crawler, Googlebot genaamd. Wat de crawler verzamelt, gaat daarna naar het indexeringsproces. Je stuurt zijn gedrag met het robots.txt-bestand, dat aangeeft welke delen het wel of niet mag bezoeken, en met interne links, die het helpen al je pagina’s te bereiken. Omdat elke site een beperkt crawlbudget heeft, loont het om het werk makkelijk te maken met een heldere structuur, een sitemap en door dubbele of waardeloze pagina’s te vermijden.