5 septembre 2026 Le média qui relie le web à vos décisions

Robots.txt disallow vs balise meta noindex : laquelle utiliser pour désindexer une page sans erreur

Bloquer une page dans le robots.txt ne la retire pas forcément de Google, et l'associer à un noindex produit parfois l'effet inverse de celui recherché. Voici la différence exacte entre ces deux mécanismes, l'erreur qui piège le plus de sites, et la bonne méthode pour désindexer une page proprement.

Développeur analysant un fichier robots.txt et une console de recherche sur plusieurs écrans dans un bureau lumineux

Développeur analysant un fichier robots.txt et une console de recherche sur plusieurs écrans dans un bureau lumineux

L'essentiel

  • Le robots.txt bloque le crawl (l'exploration) d'une page par Googlebot, mais ne garantit pas son retrait de l'index : une URL déjà connue peut rester indexée sans description.
  • La balise meta noindex, elle, retire réellement une page des résultats de recherche, mais seulement si Googlebot peut encore explorer la page pour la lire.
  • L'erreur la plus fréquente consiste à bloquer une page en disallow ET à lui ajouter un noindex en même temps : Google ne peut alors plus voir la balise, et la page reste indexée sous forme d'URL nue.
  • Pour désindexer proprement une page, il faut d'abord autoriser le crawl, laisser Google lire le noindex, confirmer le retrait dans Search Console, puis seulement ensuite bloquer le crawl si besoin.
  • Pour les fichiers non-HTML (PDF, images), c'est l'en-tête HTTP X-Robots-Tag qui remplace la balise meta, puisqu'il n'existe pas de <head> dans ces formats.

Une page en double, un espace de test resté en ligne, une catégorie de filtre e-commerce qui génère des milliers d'URLs sans intérêt : la tentation est grande de vouloir la faire disparaître de Google en une seule ligne dans le robots.txt. Sauf que ce fichier n'a jamais été conçu pour désindexer quoi que ce soit, et l'associer maladroitement à une balise noindex peut même figer une page dans l'index au lieu de l'en sortir.

La différence fondamentale entre robots.txt et noindex

Le fichier robots.txt et la balise meta name="robots" agissent à deux étapes différentes du fonctionnement d'un moteur de recherche, et c'est cette différence qui explique la plupart des erreurs constatées.

Conséquence directe : une page bloquée par robots.txt peut malgré tout apparaître dans les résultats Google si elle a reçu des liens externes, car le moteur connaît son existence sans avoir pu l'explorer. Elle s'affiche alors sans titre ni description générés à partir du contenu, avec une mention du type « aucune information n'est disponible pour cette page ». C'est indésirable, mais ce n'est pas une désindexation.

L'erreur classique : bloquer en disallow ET vouloir désindexer

La confusion la plus répandue consiste à combiner les deux mécanismes en pensant qu'ils se renforcent : ajouter une ligne Disallow dans le robots.txt et une balise noindex sur la page elle-même, pour « être sûr » qu'elle disparaisse.

Le cas « Disallow + noindex » est le piège le plus fréquent : les deux directives s'annulent au lieu de s'additionner.

Google lui-même déconseille explicitement cette combinaison depuis plusieurs années : pour qu'un noindex fonctionne, la page doit rester crawlable. Si le robots.txt l'interdit, la balise devient invisible aux yeux du moteur, qui continue de traiter l'URL comme une page ordinaire découverte via des liens externes.

Quand utiliser la balise meta noindex

Le noindex est le bon outil dès que l'objectif est de retirer une page précise des résultats de recherche tout en la laissant accessible aux visiteurs et aux robots.

  • Pages de remerciement après un formulaire ou un achat, qui n'ont aucun intérêt à apparaître dans une recherche.
  • Pages de résultats de recherche interne du site, souvent dupliquées et sans valeur pour un internaute externe.
  • Contenu dupliqué volontaire qu'il n'est pas possible de canonicaliser proprement, par exemple certaines variantes de fiches produit.
  • Pages de pagination avancée ou de tri/filtre qui n'apportent rien de plus que la page principale de la catégorie.
  • Environnements de test restés accessibles publiquement, en complément d'une protection par mot de passe si possible.

Quand utiliser le disallow du robots.txt

Le robots.txt reste pertinent, mais pour un objectif différent : économiser le budget de crawl et éviter que Googlebot ne perde du temps sur des zones sans intérêt SEO, plutôt que pour désindexer une page déjà connue.

Bon usage du disallow

  • Répertoires techniques (scripts, panier, comptes utilisateurs)
  • URLs à paramètres générant un volume massif de combinaisons inutiles
  • Pages jamais indexées et sans intérêt à explorer
  • Préserver le budget de crawl sur un gros site

Mauvais usage du disallow

  • Désindexer une page déjà présente dans Google
  • Le combiner avec un noindex sur la même URL
  • Bloquer une page qui reçoit des liens externes utiles
  • Cacher un contenu sensible (le fichier robots.txt est public)

2 étapes distinctes et successives sont nécessaires pour désindexer proprement une page déjà connue de Google : d'abord le noindex avec crawl autorisé, ensuite seulement un éventuel blocage du crawl une fois le retrait confirmé

Comment vérifier l'état réel d'une page dans Search Console

Avant toute modification, mieux vaut vérifier l'état actuel de la page dans la Search Console plutôt que de deviner.

  1. Utilisez l'outil d'inspection d'URL pour voir si Google a exploré la page, quand, et si elle est indexée.
  2. Retirez toute directive Disallow qui bloquerait cette URL dans le robots.txt, si l'objectif est de la désindexer.
  3. Ajoutez la balise noindex dans le <head> de la page, ou l'en-tête X-Robots-Tag pour un fichier non-HTML.
  4. Demandez une nouvelle exploration via le bouton « Demander une indexation » dans l'outil d'inspection d'URL, pour accélérer la prise en compte.
  5. Confirmez le retrait quelques jours plus tard dans le rapport « Pages » de Search Console, section « Exclue par la balise noindex ».
  6. Bloquez ensuite le crawl si nécessaire, une fois la désindexation confirmée, pour économiser le budget de crawl sur une page qui ne sera plus revisitée.

Pour une désindexation plus urgente (contenu sensible publié par erreur), l'outil de suppressions temporaires de Search Console masque une URL des résultats pendant environ six mois, le temps que le noindex ou la suppression définitive de la page prenne effet en arrière-plan.

Le robots.txt dit à Google où ne pas regarder ; le noindex lui dit ce qu'il ne faut pas garder. Confondre les deux revient à fermer une porte tout en espérant qu'on lise l'écriteau posé derrière.

Cas particuliers : X-Robots-Tag, PDF et pages non-HTML

Un fichier PDF, une image ou un document Word ne possède pas de balise <head> où insérer un meta noindex. Pour ces formats, l'équivalent s'applique via l'en-tête de réponse HTTP X-Robots-Tag: noindex, configuré au niveau du serveur (Apache, Nginx) ou du CDN plutôt que dans le fichier lui-même.

Ce type d'audit technique gagne à être systématisé après toute refonte ou migration de site, moment où les erreurs de robots.txt et de balises noindex se multiplient le plus souvent ; notre checklist SEO après une refonte détaille les points à vérifier en priorité pour éviter une chute de trafic organique évitable.

Questions fréquentes

Le robots.txt suffit-il pour désindexer une page de Google ?

Non. Le robots.txt bloque uniquement l'exploration de la page par Googlebot. Si la page est déjà connue ou reçoit des liens externes, elle peut rester indexée sans description, ce qui n'est pas l'effet recherché lors d'une véritable désindexation.

Pourquoi ma page reste indexée alors que j'ai ajouté un noindex ?

Le cas le plus fréquent est que la page soit aussi bloquée par le robots.txt : Googlebot ne peut alors plus l'explorer pour lire la balise noindex, et la page reste indexée. Il faut retirer le blocage du crawl pour que le noindex soit pris en compte.

Faut-il bloquer une page en robots.txt après l'avoir désindexée avec un noindex ?

C'est possible une fois le retrait confirmé dans Search Console, pour économiser le budget de crawl sur une page qui n'a plus vocation à être revisitée. Le bloquer avant la confirmation empêcherait Google de constater le noindex.

Comment désindexer un fichier PDF ou une image qui n'a pas de balise meta ?

Ces formats n'ont pas de <head> HTML : l'équivalent du noindex s'y applique via l'en-tête HTTP X-Robots-Tag, configuré au niveau du serveur ou du CDN plutôt que dans le fichier.

Le robots.txt permet-il de cacher une page sensible aux internautes ?

Non, le fichier robots.txt est public et consultable par n'importe qui à l'adresse /robots.txt d'un site. Il indique au contraire les zones que l'on souhaite garder hors du crawl, ce qui peut même signaler leur existence à un visiteur curieux.

#robots.txt#meta noindex#désindexation#SEO technique#Google Search Console
ConfigurationEffet réel sur Google
Disallow seul, sans noindexPage non explorée, peut rester indexée sans description si des liens pointent vers elle
Noindex seul, page explorablePage explorée, balise lue, retrait effectif de l'index après un nouveau passage de Google
Disallow + noindex en même tempsGooglebot ne peut pas explorer la page, donc ne lit jamais le noindex : la page reste indexée
Aucune directivePage explorée et indexée normalement