Crawler (robot d’exploration)
Un crawler (ou robot d’exploration) est un programme qui parcourt le web de façon automatique, sautant de lien en lien pour découvrir des pages et en lire le contenu. C’est la première étape du fonctionnement d’un moteur de recherche : avant d’afficher une page dans les résultats, Google doit la trouver et l’explorer avec son crawler, appelé Googlebot. Ce que le crawler recueille est ensuite transmis au processus d’indexation. Vous pouvez guider son comportement avec le fichier robots.txt, qui indique les zones qu’il peut ou non visiter, et avec les liens internes, qui l’aident à atteindre toutes vos pages. Comme chaque site dispose d’un budget d’exploration limité, il est utile de lui faciliter la tâche avec une structure claire, un sitemap et en évitant les pages dupliquées ou sans valeur.