En clair
Le crawl est le passage d'un robot qui lit tes pages et suit tes liens. Googlebot arrive par un lien, un sitemap ou une page qu'il connait déjà, télécharge le code, puis repart vers les adresses qu'il y a trouvées.
Un exemple concret
Le robot de Google arrive sur la page d'accueil d'une boutique, suit le lien vers la catégorie des robes, puis vers chaque robe. Une robe qu'aucune page ne relie reste invisible pour lui, même si elle existe bel et bien sur le site.
Pourquoi ça compte
Sans exploration, aucune indexation. Une page qu'aucun lien ne pointe et qui n'est dans aucun sitemap peut rester invisible indéfiniment.
Comment t'en servir
- Vérifie que chaque page importante est accessible en quelques clics depuis l'accueil.
- Évite de bloquer par erreur des dossiers entiers dans le fichier robots.txt.
- Supprime ou regroupe les pages inutiles qui font perdre du temps au robot.
L'erreur fréquente
Bloquer une page dans le robots.txt ne la retire pas des résultats. Elle peut y rester, sans description, parce que Google en connait l'adresse sans pouvoir la lire.
Aussi appelé exploration, robot, googlebot.
Les questions qu'on se pose ensuite
Le crawl, c'est la visite du robot qui lit la page. L'indexation, c'est la décision de la ranger dans l'index pour la montrer dans les résultats. Une page peut être visitée sans être indexée.
Pas directement. Un site mis à jour régulièrement, rapide et bien relié est visité plus souvent. Pour une page précise, l'outil d'inspection d'URL permet de demander une nouvelle visite.
