En clair
Le fichier robots.txt se place à la racine du site et indique aux robots les chemins qu'ils peuvent parcourir. C'est une consigne, respectée par les robots sérieux, ignorée par les autres.
Un exemple concret
Un site de petites annonces bloque dans son robots.txt les milliers de pages de recherche interne, qui n'apportent rien. Le robot de Google passe alors son temps sur les annonces elles-mêmes, qui sont celles qu'on veut voir sortir.
Pourquoi ça compte
Il évite de faire perdre du temps aux robots sur des pages sans intérêt, et il déclare l'adresse de ton sitemap.
Comment t'en servir
- Ouvre tonsite.fr/robots.txt pour voir ce qui est bloqué aujourd'hui.
- Ne bloque jamais une page que tu veux voir dans Google.
- Pour retirer une page des résultats, utilise une balise noindex, pas le robots.txt.
L'erreur fréquente
Il empêche l'exploration, pas l'indexation. Pour qu'une page disparaisse vraiment des résultats, il faut la laisser accessible et y poser une balise noindex.
Les questions qu'on se pose ensuite
Non. Le robots.txt empêche la visite, pas l'indexation. Une page bloquée peut rester dans les résultats si d'autres sites la citent, sans que Google puisse lire son contenu.
Oui, la plupart des robots d'IA connus le respectent, comme GPTBot. Bloquer protège ton contenu, mais te retire aussi des réponses qu'ils construisent.
