Robots.txt et SEO

Robots.txt SEO
Guide SEO Technique

Comprendre et optimiser le robots.txt

Le fichier robots.txt indique aux moteurs de recherche quelles parties de votre site ils peuvent ou ne peuvent pas crawler. Un outil puissant pour gérer le budget crawl et protéger certaines sections.

Qu'est-ce que le robots.txt ?

  • Fichier texte placé à la racine du site (/robots.txt)
  • Lu par les robots des moteurs de recherche
  • Contient des directives de crawl
  • Standard du protocole REP (Robots Exclusion Protocol)

Syntaxe de base

  • User-agent: * : S'applique à tous les robots
  • Disallow: /dossier/ : Interdit le crawl d'un dossier
  • Allow: /dossier/page : Autorise une exception
  • Sitemap: : Indique l'emplacement du sitemap XML

Cas d'usage courants

Protéger des ressources

  • Pages d'administration (/admin/, /wp-admin/)
  • Pages de panier et checkout
  • Résultats de recherche interne
  • Pages de login et espaces privés

Optimiser le budget crawl

  • Bloquer les pages de filtres e-commerce
  • Bloquer les paramètres de tri
  • Éviter le crawl de ressources inutiles (CSS, JS si nécessaire)
  • Limiter la pagination excessive

Attention : ce que robots.txt ne fait pas

  • N'empêche pas l'indexation : Une page bloquée peut être indexée (sans contenu)
  • N'est pas une sécurité : Le fichier est public et peut être ignoré
  • N'empêche pas les liens : Les backlinks vers des pages bloquées transmettent du jus

Robots.txt vs alternatives

  • Robots.txt : Bloque le crawl
  • Noindex : Bloque l'indexation (mais permet le crawl)
  • Canonical : Consolide les duplicatas
  • Nofollow : Bloque le suivi des liens

Tester votre robots.txt

  • Outil de test dans Google Search Console
  • Vérifier que les pages importantes ne sont pas bloquées
  • Tester après chaque modification
  • Attention aux erreurs de syntaxe

Découvrez aussi notre guide sur le budget crawl et notre audit SEO technique.

FAQ

Questions fréquentes

Faut-il un robots.txt sur tous les sites ?

Oui, même un fichier vide ou permissif (Allow: /). L'absence de robots.txt n'est pas un problème mais en avoir un permet de déclarer le sitemap et d'anticiper les besoins futurs.

Peut-on bloquer le crawl de CSS et JavaScript ?

Déconseillé ! Google a besoin de rendre vos pages comme un navigateur. Bloquer CSS/JS peut l'empêcher de comprendre votre contenu et dégrader votre SEO.

Comment désindexer une page bloquée par robots.txt ?

Paradoxalement, c'est difficile. Si une page est bloquée au crawl, Google ne peut pas lire la balise noindex. Retirez le blocage temporairement, ajoutez noindex, attendez la désindexation, puis rebloquez si nécessaire.

Les directives Crawl-delay sont-elles respectées ?

Google ignore la directive Crawl-delay. Bing et d'autres la respectent. Pour limiter la fréquence de crawl de Google, utilisez les paramètres dans Search Console.

Besoin d'optimiser votre robots.txt ?

Un audit technique pour identifier les problèmes de crawl.