Aller au contenu

Outil gratuit

Cette adresse est-elle ouverte aux robots ?

On lit le robots.txt du domaine et, si vous donnez une adresse, on dit si un robot précis a le droit de la parcourir — avec la règle qui décide, pas seulement le fichier brut.

Sans inscription, sans e-mail à laisser. Vous pouvez coller une adresse complète : nous en extrayons le domaine.

À quoi sert de le tester

Un robots.txt mal réglé se paie des deux côtés : une ligne de trop et le moteur cesse d'explorer des pages que vous vouliez voir sortir ; une ligne de moins et il parcourt ce que vous gardiez tranquille. Le fichier ne prévient jamais, et personne ne relit le sien.

Comment l'outil décide

Il lit le robots.txt du domaine, le découpe en groupes, puis applique la règle exacte des moteurs : d'abord le groupe du robot le plus spécifique, ensuite la règle dont le chemin est le plus long, et à longueur égale Allow l'emporte. La même logique qu'un robot, sans l'approximation d'une lecture à l'oeil.

La règle qui gagne

Un robots.txt ne se lit pas de haut en bas

Un robot ne prend pas la première ligne qui correspond. Il prend le groupe le plus précis, puis, dedans, la règle au chemin le plus long. Changez de cas : la ligne qui l'emporte s'allume.

Googlebot/wp-admin/options.php

User-agent: *
Disallow: /wp-admin/bloqué
Allow: /wp-admin/admin-ajax.php
 
User-agent: AhrefsBot
Disallow: /

Googlebot n'a pas de groupe à son nom : il suit celui de l'étoile. Une seule règle correspond à ce chemin, Disallow sur le dossier. La page est fermée.

Fichier d'exemple, sur un nom de domaine réservé aux démonstrations. La règle de précédence est celle de la RFC 9309 et de la documentation de Google.

Trois lignes

Tout un robots.txt tient en trois directives.

Le reste n'est que des noms de robots et des bouts de chemin.

  • Disallowun chemin qu'on demande aux robots de ne pas parcourir
  • Allowl'exception qui rouvre un sous-chemin fermé au-dessus
  • Sitemapl'adresse du plan du site, lue par tous les moteurs

Lire le résultat

Le verdict porte sur le chemin que vous avez donné ; les constats, eux, portent sur le fichier entier.

Chemin autorisé
Aucune règle ne ferme ce chemin dans le groupe retenu, ou bien la plus longue est un Allow. Le robot peut y aller.
Chemin bloqué
La règle la plus longue qui corresponde est un Disallow. Le robot visé ne parcourra pas cette adresse. Voulu ou non, c'est à vous de trancher — l'outil dit seulement laquelle des lignes a gagné.
Fichier trouvé
Le serveur répond 200 et le fichier se découpe proprement en groupes. C'est l'état normal.
Pas de robots.txt
Le site n'en a pas. Pour un robot, tout est autorisé : c'est parfaitement valide, simplement aucun sitemap n'est déclaré.
Tout est bloqué
Le groupe qui vise tous les robots interdit la racine. Sur un site en production, c'est le premier réflexe à vérifier après une mise en ligne.
Aucun sitemap
Le fichier ne pointe vers aucun plan de site. Une seule ligne suffit à le déclarer, et tous les moteurs la lisent.
Injoignable
Aucune réponse dans le délai : serveur muet, nom qui ne résout pas, ou blocage en amont. Rien ne peut être conclu.

La syntaxe d'un robots.txt

Quatre directives et deux jokers. Tout ce qui n'est pas dans cette table est ignoré par les moteurs.

ÉcritureCe qu'elle faitExemple
User-agentOuvre un groupe visant un robot, ou tous avec une étoileUser-agent: Googlebot
DisallowDemande de ne pas parcourir un cheminDisallow: /panier
AllowRouvre un sous-chemin fermé juste au-dessusAllow: /panier/aide
SitemapDonne l'adresse complète du plan de siteSitemap: https://example.com/sitemap.xml
*Joker : n'importe quelle suite de caractèresDisallow: /*.pdf
$Ancre la fin de l'adresseDisallow: /*.php$

Crawl-delay se rencontre souvent mais ne fait pas partie du standard : Google l'ignore, Bing et Yandex le lisent.

Questions fréquentes

Un Disallow cache-t-il ma page ?

Non. Il demande de ne pas la parcourir, pas de ne pas l'indexer. Une page bloquée mais liée depuis ailleurs peut très bien apparaître dans les résultats, sans description. Pour la retirer vraiment, il faut une balise noindex ou un mot de passe — et donc laisser le robot y accéder pour qu'il lise cette balise.

Où doit se trouver le fichier ?

À la racine du domaine, et nulle part ailleurs : example.com/robots.txt. Un fichier posé dans un sous-dossier n'est jamais lu. Et chaque sous-domaine a le sien, séparé.

Quel groupe s'applique quand plusieurs correspondent ?

Le plus spécifique. Si un robot a son propre groupe à son nom, il ignore entièrement le groupe qui vise tout le monde. À l'intérieur du groupe retenu, c'est la règle au chemin le plus long qui décide, et à longueur égale, Allow l'emporte sur Disallow.

Faut-il déclarer son sitemap dedans ?

Ce n'est pas obligatoire, mais c'est utile : la ligne Sitemap est lue par tous les moteurs et leur donne l'adresse de votre plan sans qu'ils aient à la chercher.

Gardez-vous ce que je teste ?

Non. Ni le domaine, ni le chemin, ni le résultat ne sont enregistrés. Le fichier est lu à l'instant, affiché, puis oublié.

0

La protection qu'un Disallow apporte à une page. Un robots.txt est un panneau, pas une serrure : il demande à un robot poli de ne pas entrer. Il ne cache rien, ne protège rien, et le fichier lui-même est public.

Pour retirer une page des résultats, il faut une balise noindex ou un mot de passe. Un Disallow peut même laisser l'adresse s'afficher dans Google, sans son contenu.

Quatre pièges

Ce qui casse un référencement en une ligne

Quatre erreurs qu'on retrouve sur une bonne part des sites qu'on reprend. Toutes tiennent en une ligne de trop, ou mal placée.

  1. Bloquer le CSS et le JavaScript

    Un Disallow sur le dossier des ressources empêche le moteur de charger la feuille de style et les scripts. Il affiche alors une page cassée, et la juge telle qu'il la voit. Les fichiers d'affichage doivent rester ouverts.
  2. Confondre Disallow et noindex

    Le premier empêche de parcourir, le second d'indexer. Une page bloquée mais liée ailleurs peut ressortir quand même. Et si le robot n'a pas le droit d'entrer, il ne lira jamais le noindex que vous avez posé dedans.
  3. Oublier un robots.txt de pré-production

    Le Disallow sur la racine qui protégeait le site de recette part parfois en production avec le reste. Le site disparaît des moteurs en quelques jours, sans aucune alerte.
  4. Le poser ailleurs qu'à la racine

    Un robots.txt n'est lu qu'à une seule adresse, à la racine du domaine. Dans un sous-dossier, il n'existe pas pour les moteurs. Et un sous-domaine a le sien, complètement séparé.