Robots.txt disallow vs balise meta noindex : laquelle utiliser pour désindexer une page sans erreur
Bloquer une page dans le robots.txt ne la retire pas forcément de Google, et l'associer à un noindex produit parfois l'effet inverse de celui recherché. Voici la différence exacte entre ces deux mécanismes, l'erreur qui piège le plus de sites, et la bonne méthode pour désindexer une page proprement.
RechercheLa rédaction Net2One7 min de lectureEnrichi par IA
Développeur analysant un fichier robots.txt et une console de recherche sur plusieurs écrans dans un bureau lumineux
L'essentiel
Le robots.txt bloque le crawl (l'exploration) d'une page par Googlebot, mais ne garantit pas son retrait de l'index : une URL déjà connue peut rester indexée sans description.
La balise meta noindex, elle, retire réellement une page des résultats de recherche, mais seulement si Googlebot peut encore explorer la page pour la lire.
L'erreur la plus fréquente consiste à bloquer une page en disallow ET à lui ajouter un noindex en même temps : Google ne peut alors plus voir la balise, et la page reste indexée sous forme d'URL nue.
Pour désindexer proprement une page, il faut d'abord autoriser le crawl, laisser Google lire le noindex, confirmer le retrait dans Search Console, puis seulement ensuite bloquer le crawl si besoin.
Pour les fichiers non-HTML (PDF, images), c'est l'en-tête HTTP X-Robots-Tag qui remplace la balise meta, puisqu'il n'existe pas de <head> dans ces formats.
Une page en double, un espace de test resté en ligne, une catégorie de filtre e-commerce qui génère des milliers d'URLs sans intérêt : la tentation est grande de vouloir la faire disparaître de Google en une seule ligne dans le robots.txt. Sauf que ce fichier n'a jamais été conçu pour désindexer quoi que ce soit, et l'associer maladroitement à une balise noindex peut même figer une page dans l'index au lieu de l'en sortir.
La différence fondamentale entre robots.txt et noindex
Le fichier robots.txt et la balise meta name="robots" agissent à deux étapes différentes du fonctionnement d'un moteur de recherche, et c'est cette différence qui explique la plupart des erreurs constatées.
Conséquence directe : une page bloquée par robots.txt peut malgré tout apparaître dans les résultats Google si elle a reçu des liens externes, car le moteur connaît son existence sans avoir pu l'explorer. Elle s'affiche alors sans titre ni description générés à partir du contenu, avec une mention du type « aucune information n'est disponible pour cette page ». C'est indésirable, mais ce n'est pas une désindexation.
L'erreur classique : bloquer en disallow ET vouloir désindexer
La confusion la plus répandue consiste à combiner les deux mécanismes en pensant qu'ils se renforcent : ajouter une ligne Disallow dans le robots.txt et une balise noindex sur la page elle-même, pour « être sûr » qu'elle disparaisse.
Configuration
Effet réel sur Google
Disallow seul, sans noindex
Page non explorée, peut rester indexée sans description si des liens pointent vers elle
Noindex seul, page explorable
Page explorée, balise lue, retrait effectif de l'index après un nouveau passage de Google
Disallow + noindex en même temps
Googlebot ne peut pas explorer la page, donc ne lit jamais le noindex : la page reste indexée
Aucune directive
Page explorée et indexée normalement
Le cas « Disallow + noindex » est le piège le plus fréquent : les deux directives s'annulent au lieu de s'additionner.
Google lui-même déconseille explicitement cette combinaison depuis plusieurs années : pour qu'un noindex fonctionne, la page doit rester crawlable. Si le robots.txt l'interdit, la balise devient invisible aux yeux du moteur, qui continue de traiter l'URL comme une page ordinaire découverte via des liens externes.
Quand utiliser la balise meta noindex
Le noindex est le bon outil dès que l'objectif est de retirer une page précise des résultats de recherche tout en la laissant accessible aux visiteurs et aux robots.
Pages de remerciement après un formulaire ou un achat, qui n'ont aucun intérêt à apparaître dans une recherche.
Pages de résultats de recherche interne du site, souvent dupliquées et sans valeur pour un internaute externe.
Contenu dupliqué volontaire qu'il n'est pas possible de canonicaliser proprement, par exemple certaines variantes de fiches produit.
Pages de pagination avancée ou de tri/filtre qui n'apportent rien de plus que la page principale de la catégorie.
Environnements de test restés accessibles publiquement, en complément d'une protection par mot de passe si possible.
Quand utiliser le disallow du robots.txt
Le robots.txt reste pertinent, mais pour un objectif différent : économiser le budget de crawl et éviter que Googlebot ne perde du temps sur des zones sans intérêt SEO, plutôt que pour désindexer une page déjà connue.
URLs à paramètres générant un volume massif de combinaisons inutiles
Pages jamais indexées et sans intérêt à explorer
Préserver le budget de crawl sur un gros site
Mauvais usage du disallow
Désindexer une page déjà présente dans Google
Le combiner avec un noindex sur la même URL
Bloquer une page qui reçoit des liens externes utiles
Cacher un contenu sensible (le fichier robots.txt est public)
2étapes distinctes et successives sont nécessaires pour désindexer proprement une page déjà connue de Google : d'abord le noindex avec crawl autorisé, ensuite seulement un éventuel blocage du crawl une fois le retrait confirmé
Comment vérifier l'état réel d'une page dans Search Console
Avant toute modification, mieux vaut vérifier l'état actuel de la page dans la Search Console plutôt que de deviner.
Utilisez l'outil d'inspection d'URL pour voir si Google a exploré la page, quand, et si elle est indexée.
Retirez toute directive Disallow qui bloquerait cette URL dans le robots.txt, si l'objectif est de la désindexer.
Ajoutez la balise noindex dans le <head> de la page, ou l'en-tête X-Robots-Tag pour un fichier non-HTML.
Demandez une nouvelle exploration via le bouton « Demander une indexation » dans l'outil d'inspection d'URL, pour accélérer la prise en compte.
Confirmez le retrait quelques jours plus tard dans le rapport « Pages » de Search Console, section « Exclue par la balise noindex ».
Bloquez ensuite le crawl si nécessaire, une fois la désindexation confirmée, pour économiser le budget de crawl sur une page qui ne sera plus revisitée.
Pour une désindexation plus urgente (contenu sensible publié par erreur), l'outil de suppressions temporaires de Search Console masque une URL des résultats pendant environ six mois, le temps que le noindex ou la suppression définitive de la page prenne effet en arrière-plan.
Le robots.txt dit à Google où ne pas regarder ; le noindex lui dit ce qu'il ne faut pas garder. Confondre les deux revient à fermer une porte tout en espérant qu'on lise l'écriteau posé derrière.
Cas particuliers : X-Robots-Tag, PDF et pages non-HTML
Un fichier PDF, une image ou un document Word ne possède pas de balise <head> où insérer un meta noindex. Pour ces formats, l'équivalent s'applique via l'en-tête de réponse HTTP X-Robots-Tag: noindex, configuré au niveau du serveur (Apache, Nginx) ou du CDN plutôt que dans le fichier lui-même.
Ce type d'audit technique gagne à être systématisé après toute refonte ou migration de site, moment où les erreurs de robots.txt et de balises noindex se multiplient le plus souvent ; notre checklist SEO après une refonte détaille les points à vérifier en priorité pour éviter une chute de trafic organique évitable.
Questions fréquentes
Le robots.txt suffit-il pour désindexer une page de Google ?
Non. Le robots.txt bloque uniquement l'exploration de la page par Googlebot. Si la page est déjà connue ou reçoit des liens externes, elle peut rester indexée sans description, ce qui n'est pas l'effet recherché lors d'une véritable désindexation.
Pourquoi ma page reste indexée alors que j'ai ajouté un noindex ?
Le cas le plus fréquent est que la page soit aussi bloquée par le robots.txt : Googlebot ne peut alors plus l'explorer pour lire la balise noindex, et la page reste indexée. Il faut retirer le blocage du crawl pour que le noindex soit pris en compte.
Faut-il bloquer une page en robots.txt après l'avoir désindexée avec un noindex ?
C'est possible une fois le retrait confirmé dans Search Console, pour économiser le budget de crawl sur une page qui n'a plus vocation à être revisitée. Le bloquer avant la confirmation empêcherait Google de constater le noindex.
Comment désindexer un fichier PDF ou une image qui n'a pas de balise meta ?
Ces formats n'ont pas de <head> HTML : l'équivalent du noindex s'y applique via l'en-tête HTTP X-Robots-Tag, configuré au niveau du serveur ou du CDN plutôt que dans le fichier.
Le robots.txt permet-il de cacher une page sensible aux internautes ?
Non, le fichier robots.txt est public et consultable par n'importe qui à l'adresse /robots.txt d'un site. Il indique au contraire les zones que l'on souhaite garder hors du crawl, ce qui peut même signaler leur existence à un visiteur curieux.
Un bouton qui se dérobe au moment de cliquer, un texte qui saute deux lignes plus bas pendant la lecture : ces sautes visuelles ont un nom précis et un score mesurable par Google. Voici ce que mesure exactement le CLS, ses causes les plus fréquentes, et comment le corriger sans tout reconstruire.
Un sitemap absent ou mal configuré n'empêche pas Google d'explorer un site, mais ralentit sérieusement la découverte de nouvelles pages. Voici comment créer un sitemap XML propre, le soumettre correctement, et les erreurs qui le rendent inutile.
Un contenu de qualité mal relié au reste du site perd une bonne partie de son potentiel. Voici comment construire un maillage interne qui distribue efficacement l'autorité entre les pages et aide Google à comprendre la hiérarchie du site.