Réponse rapide : le fichier robots.txt donne des consignes d’exploration aux robots des moteurs de recherche. Il permet d’autoriser ou de bloquer certaines zones d’un site pour le crawl. En revanche, il ne doit pas être utilisé comme outil principal pour désindexer une page déjà connue par Google.
Le fichier robots.txt est un fichier texte placé à la racine d’un site Internet. Il indique aux robots d’exploration, comme Googlebot, quelles zones du site ils peuvent parcourir et quelles zones ils doivent éviter.
Son adresse est généralement de cette forme : https://www.exemple.com/robots.txt.
En SEO, robots.txt sert principalement à orienter le crawl. Il permet d’éviter que les moteurs perdent du temps sur des espaces sans intérêt pour le référencement : pages internes, paramètres techniques, paniers, filtres inutiles ou fichiers temporaires.
noindex.Nous voyons régulièrement des sites où robots.txt est utilisé pour bloquer des pages problématiques. C’est rarement la bonne méthode. Il faut distinguer bloquer le crawl et empêcher l’indexation.
User-agent: *
Disallow: /admin/
Disallow: /panier/
Sitemap: https://www.exemple.com/sitemap.xml
La directive Disallow: / peut empêcher l’exploration complète d’un site si elle est oubliée après une préproduction.
Google doit pouvoir accéder aux fichiers CSS et JavaScript nécessaires pour comprendre le rendu réel d’une page.
Un fichier robots.txt est public. Il ne doit jamais servir à protéger des informations confidentielles.
Robots.txt est un outil technique utile, mais il doit être manipulé avec prudence. Une mauvaise directive peut empêcher Google de découvrir des pages importantes.
Besoin d’un audit SEO technique ? Com’online analyse votre robots.txt, votre sitemap XML et les freins techniques qui limitent votre visibilité.
Vous aimez ? Partagez !