Comprendre et optimiser le robots.txt
Le fichier robots.txt indique aux moteurs de recherche quelles parties de votre site ils peuvent ou ne peuvent pas crawler. Un outil puissant pour gérer le budget crawl et protéger certaines sections.
Qu'est-ce que le robots.txt ?
- Fichier texte placé à la racine du site (/robots.txt)
- Lu par les robots des moteurs de recherche
- Contient des directives de crawl
- Standard du protocole REP (Robots Exclusion Protocol)
Syntaxe de base
- User-agent: * : S'applique à tous les robots
- Disallow: /dossier/ : Interdit le crawl d'un dossier
- Allow: /dossier/page : Autorise une exception
- Sitemap: : Indique l'emplacement du sitemap XML
Cas d'usage courants
Protéger des ressources
- Pages d'administration (/admin/, /wp-admin/)
- Pages de panier et checkout
- Résultats de recherche interne
- Pages de login et espaces privés
Optimiser le budget crawl
- Bloquer les pages de filtres e-commerce
- Bloquer les paramètres de tri
- Éviter le crawl de ressources inutiles (CSS, JS si nécessaire)
- Limiter la pagination excessive
Attention : ce que robots.txt ne fait pas
- N'empêche pas l'indexation : Une page bloquée peut être indexée (sans contenu)
- N'est pas une sécurité : Le fichier est public et peut être ignoré
- N'empêche pas les liens : Les backlinks vers des pages bloquées transmettent du jus
Robots.txt vs alternatives
- Robots.txt : Bloque le crawl
- Noindex : Bloque l'indexation (mais permet le crawl)
- Canonical : Consolide les duplicatas
- Nofollow : Bloque le suivi des liens
Tester votre robots.txt
- Outil de test dans Google Search Console
- Vérifier que les pages importantes ne sont pas bloquées
- Tester après chaque modification
- Attention aux erreurs de syntaxe
Découvrez aussi notre guide sur le budget crawl et notre audit SEO technique.
Questions fréquentes
Faut-il un robots.txt sur tous les sites ?
Oui, même un fichier vide ou permissif (Allow: /). L'absence de robots.txt n'est pas un problème mais en avoir un permet de déclarer le sitemap et d'anticiper les besoins futurs.
Peut-on bloquer le crawl de CSS et JavaScript ?
Déconseillé ! Google a besoin de rendre vos pages comme un navigateur. Bloquer CSS/JS peut l'empêcher de comprendre votre contenu et dégrader votre SEO.
Comment désindexer une page bloquée par robots.txt ?
Paradoxalement, c'est difficile. Si une page est bloquée au crawl, Google ne peut pas lire la balise noindex. Retirez le blocage temporairement, ajoutez noindex, attendez la désindexation, puis rebloquez si nécessaire.
Les directives Crawl-delay sont-elles respectées ?
Google ignore la directive Crawl-delay. Bing et d'autres la respectent. Pour limiter la fréquence de crawl de Google, utilisez les paramètres dans Search Console.
Besoin d'optimiser votre robots.txt ?
Un audit technique pour identifier les problèmes de crawl.
