Outil gratuit
Cette adresse est-elle ouverte aux robots ?
On lit le robots.txt du domaine et, si vous donnez une adresse, on dit si un robot précis a le droit de la parcourir — avec la règle qui décide, pas seulement le fichier brut.
À quoi sert de le tester
Un robots.txt mal réglé se paie des deux côtés : une ligne de trop et le moteur cesse d'explorer des pages que vous vouliez voir sortir ; une ligne de moins et il parcourt ce que vous gardiez tranquille. Le fichier ne prévient jamais, et personne ne relit le sien.
Comment l'outil décide
Il lit le robots.txt du domaine, le découpe en groupes, puis applique la règle exacte des moteurs : d'abord le groupe du robot le plus spécifique, ensuite la règle dont le chemin est le plus long, et à longueur égale Allow l'emporte. La même logique qu'un robot, sans l'approximation d'une lecture à l'oeil.
La règle qui gagne
Un robots.txt ne se lit pas de haut en bas
Un robot ne prend pas la première ligne qui correspond. Il prend le groupe le plus précis, puis, dedans, la règle au chemin le plus long. Changez de cas : la ligne qui l'emporte s'allume.
Googlebot→/wp-admin/options.php
User-agent: *Disallow: /wp-admin/← bloquéAllow: /wp-admin/admin-ajax.phpUser-agent: AhrefsBotDisallow: /
Googlebot n'a pas de groupe à son nom : il suit celui de l'étoile. Une seule règle correspond à ce chemin, Disallow sur le dossier. La page est fermée.
Fichier d'exemple, sur un nom de domaine réservé aux démonstrations. La règle de précédence est celle de la RFC 9309 et de la documentation de Google.
Trois lignes
Tout un robots.txt tient en trois directives.
Le reste n'est que des noms de robots et des bouts de chemin.
- Disallowun chemin qu'on demande aux robots de ne pas parcourir
- Allowl'exception qui rouvre un sous-chemin fermé au-dessus
- Sitemapl'adresse du plan du site, lue par tous les moteurs
Lire le résultat
Le verdict porte sur le chemin que vous avez donné ; les constats, eux, portent sur le fichier entier.
- Chemin autorisé
- Aucune règle ne ferme ce chemin dans le groupe retenu, ou bien la plus longue est un Allow. Le robot peut y aller.
- Chemin bloqué
- La règle la plus longue qui corresponde est un Disallow. Le robot visé ne parcourra pas cette adresse. Voulu ou non, c'est à vous de trancher — l'outil dit seulement laquelle des lignes a gagné.
- Fichier trouvé
- Le serveur répond 200 et le fichier se découpe proprement en groupes. C'est l'état normal.
- Pas de robots.txt
- Le site n'en a pas. Pour un robot, tout est autorisé : c'est parfaitement valide, simplement aucun sitemap n'est déclaré.
- Tout est bloqué
- Le groupe qui vise tous les robots interdit la racine. Sur un site en production, c'est le premier réflexe à vérifier après une mise en ligne.
- Aucun sitemap
- Le fichier ne pointe vers aucun plan de site. Une seule ligne suffit à le déclarer, et tous les moteurs la lisent.
- Injoignable
- Aucune réponse dans le délai : serveur muet, nom qui ne résout pas, ou blocage en amont. Rien ne peut être conclu.
La syntaxe d'un robots.txt
Quatre directives et deux jokers. Tout ce qui n'est pas dans cette table est ignoré par les moteurs.
| Écriture | Ce qu'elle fait | Exemple |
|---|---|---|
| User-agent | Ouvre un groupe visant un robot, ou tous avec une étoile | User-agent: Googlebot |
| Disallow | Demande de ne pas parcourir un chemin | Disallow: /panier |
| Allow | Rouvre un sous-chemin fermé juste au-dessus | Allow: /panier/aide |
| Sitemap | Donne l'adresse complète du plan de site | Sitemap: https://example.com/sitemap.xml |
| * | Joker : n'importe quelle suite de caractères | Disallow: /*.pdf |
| $ | Ancre la fin de l'adresse | Disallow: /*.php$ |
Crawl-delay se rencontre souvent mais ne fait pas partie du standard : Google l'ignore, Bing et Yandex le lisent.
Questions fréquentes
Un Disallow cache-t-il ma page ?
Non. Il demande de ne pas la parcourir, pas de ne pas l'indexer. Une page bloquée mais liée depuis ailleurs peut très bien apparaître dans les résultats, sans description. Pour la retirer vraiment, il faut une balise noindex ou un mot de passe — et donc laisser le robot y accéder pour qu'il lise cette balise.
Où doit se trouver le fichier ?
À la racine du domaine, et nulle part ailleurs : example.com/robots.txt. Un fichier posé dans un sous-dossier n'est jamais lu. Et chaque sous-domaine a le sien, séparé.
Quel groupe s'applique quand plusieurs correspondent ?
Le plus spécifique. Si un robot a son propre groupe à son nom, il ignore entièrement le groupe qui vise tout le monde. À l'intérieur du groupe retenu, c'est la règle au chemin le plus long qui décide, et à longueur égale, Allow l'emporte sur Disallow.
Faut-il déclarer son sitemap dedans ?
Ce n'est pas obligatoire, mais c'est utile : la ligne Sitemap est lue par tous les moteurs et leur donne l'adresse de votre plan sans qu'ils aient à la chercher.
Gardez-vous ce que je teste ?
Non. Ni le domaine, ni le chemin, ni le résultat ne sont enregistrés. Le fichier est lu à l'instant, affiché, puis oublié.
0
La protection qu'un Disallow apporte à une page. Un robots.txt est un panneau, pas une serrure : il demande à un robot poli de ne pas entrer. Il ne cache rien, ne protège rien, et le fichier lui-même est public.
Pour retirer une page des résultats, il faut une balise noindex ou un mot de passe. Un Disallow peut même laisser l'adresse s'afficher dans Google, sans son contenu.
Quatre pièges
Ce qui casse un référencement en une ligne
Quatre erreurs qu'on retrouve sur une bonne part des sites qu'on reprend. Toutes tiennent en une ligne de trop, ou mal placée.
Bloquer le CSS et le JavaScript
Un Disallow sur le dossier des ressources empêche le moteur de charger la feuille de style et les scripts. Il affiche alors une page cassée, et la juge telle qu'il la voit. Les fichiers d'affichage doivent rester ouverts.Confondre Disallow et noindex
Le premier empêche de parcourir, le second d'indexer. Une page bloquée mais liée ailleurs peut ressortir quand même. Et si le robot n'a pas le droit d'entrer, il ne lira jamais le noindex que vous avez posé dedans.Oublier un robots.txt de pré-production
Le Disallow sur la racine qui protégeait le site de recette part parfois en production avec le reste. Le site disparaît des moteurs en quelques jours, sans aucune alerte.Le poser ailleurs qu'à la racine
Un robots.txt n'est lu qu'à une seule adresse, à la racine du domaine. Dans un sous-dossier, il n'existe pas pour les moteurs. Et un sous-domaine a le sien, complètement séparé.
Vingt contrôles, sans inscription
- Vérifier l'expiration de cinquante domaines d'un coup
- À qui appartient ce domaine, et depuis quand ?
- Où mène vraiment cette adresse ?
- Avec quoi ce site est-il construit ?
- Où en est la propagation DNS de mon domaine ?
- Générateur d'enregistrement SPF
- Quelle est la réputation de ce domaine ?
- Les en-têtes de sécurité de ce site
- Le bilan complet d'un domaine
- Quand expire ce nom de domaine ?
- Ce certificat SSL est-il valide ?
- Vos e-mails sont-ils authentifiés ?
- Ce domaine est-il sur une liste noire ?
- Quels serveurs reçoivent les e-mails de ce domaine ?
- Quels serveurs de noms répondent pour ce domaine ?
- Quels enregistrements TXT porte ce domaine ?
- Vers quoi pointe cet alias ?