Testeur de Robots.txt

Testez et validez les fichiers robots.txt. Vérifiez si les URL sont autorisées ou bloquées pour n'importe quel robot d'exploration, analysez les directives et testez plusieurs URL en masse.

Mis à jour le

Share:
Home/SEO Tools/Robots.txt Tester

Robots.txt Tester

Test and validate robots.txt files. Check if specific URLs are allowed or blocked for any crawler, parse directives, detect issues, and bulk-test multiple URLs.

Sample Presets

Robots.txt Content

Test Settings

Questions Fréquentes

Que teste-t-il ?

Il analyse votre robots.txt et vérifie si des URL spécifiques seraient autorisées ou bloquées pour n'importe quel robot d'exploration (user-agent), selon des règles de correspondance de type Google.

Comment fonctionne la correspondance ?

La règle correspondante la plus spécifique (la plus longue) l'emporte. À spécificité égale, Allow prime sur Disallow. Prend en charge les caractères génériques * et les ancres de fin d'URL $.

Puis-je tester plusieurs URL ?

Oui — l'onglet Test groupé d'URL accepte plusieurs URL et affiche le verdict AUTORISÉ/BLOQUÉ pour chaque URL avec des totaux récapitulatifs.

Le Testeur de Robots.txt est-il gratuit ?

Oui, le Testeur de Robots.txt est 100 % gratuit, sans inscription, sans frais cachés ni limite d'utilisation. Tout le traitement se fait localement dans votre navigateur, garantissant une confidentialité totale.

Mes données sont-elles en sécurité avec cet outil ?

Absolument. Le Testeur de Robots.txt traite tout côté client, dans votre navigateur. Aucune donnée n'est envoyée ni stockée sur un serveur. Votre contenu reste privé sur votre appareil à tout moment.

Le Testeur de Robots.txt fonctionne-t-il sur les appareils mobiles ?

Oui, le Testeur de Robots.txt est entièrement responsive et fonctionne sur smartphones et tablettes. Vous pouvez l'utiliser sur n'importe quel appareil doté d'un navigateur web moderne, sans téléchargement d'application.

Dois-je créer un compte pour utiliser cet outil ?

Aucun compte ni inscription n'est nécessaire. Ouvrez simplement le Testeur de Robots.txt dans votre navigateur et commencez à l'utiliser immédiatement. Il n'y a ni page d'inscription ni restriction d'utilisation.

Cet outil suit-il les dernières directives de Google ?

Oui, le Testeur de Robots.txt est conçu en suivant les directives et les bonnes pratiques actuelles de Google Search. Nous mettons régulièrement l'outil à jour pour refléter les évolutions des exigences des moteurs de recherche.

Comment utiliser le Testeur de Robots.txt ?

Saisissez simplement votre texte dans le champ prévu, ajustez les paramètres selon vos préférences et l'outil le traitera instantanément. Vous pourrez ensuite copier le résultat dans le presse-papiers ou le télécharger.

Quels navigateurs sont pris en charge ?

Le Testeur de Robots.txt fonctionne dans tous les navigateurs modernes, y compris Chrome, Firefox, Safari, Edge et Opera. Pour une expérience optimale, utilisez la dernière version de votre navigateur préféré.

Quelle est la différence entre bloquer une page dans robots.txt et ajouter une balise noindex ?

Robots.txt contrôle l'exploration, pas l'indexation. Une règle Disallow indique aux crawlers de ne pas demander une URL, mais elle ne retire pas cette URL des résultats de recherche — si d'autres pages y font un lien, Google peut tout de même indexer ce lien sans description, puisqu'il n'a jamais été autorisé à lire la page. Une balise meta noindex ou un en-tête HTTP, à l'inverse, laisse le crawler récupérer la page puis l'exclut explicitement de l'index. Le piège, c'est que noindex ne fonctionne que si la page est explorable : la bloquer dans robots.txt empêche justement Google de jamais voir la directive noindex. Pour masquer une page de façon fiable, autorisez l'exploration et utilisez noindex ; pour économiser du budget d'exploration sur des URLs réellement sans valeur, utilisez Disallow. Ce testeur affiche le verdict exact AUTORISÉ ou BLOQUÉ afin que vous puissiez confirmer qu'une page est atteignable avant de vous fier à noindex.

Que signifient les jokers * et $ dans une règle robots.txt ?

L'astérisque (*) correspond à n'importe quelle suite de caractères, et le signe dollar ($) ancre une règle à la fin du chemin de l'URL. Ensemble, ils permettent à une seule ligne de couvrir de nombreuses URLs. Par exemple, Disallow: /*?sort= bloque tout chemin contenant un paramètre de tri, ce qui est utile pour les URLs de recherche à facettes et de filtres qui génèrent des pages en double à l'infini. Disallow: /*.pdf$ ne bloque que les URLs se terminant par .pdf, si bien qu'un chemin comme /guide.pdf?ref=email ne correspondrait pas, puisque quelque chose suit l'extension. Google et la plupart des crawlers modernes prennent en charge les deux symboles, mais il est facile de se tromper subtilement, et un joker mal placé peut bloquer bien plus que prévu. Collez votre fichier et testez une URL d'exemple ici pour voir si votre règle avec joker correspond comme vous l'attendez.

Comment bloquer des robots IA comme GPTBot sans bloquer Google ?

Vous ciblez chaque robot par son nom, dans son propre groupe de user-agent. Les crawlers de recherche et les crawlers d'entraînement IA utilisent des chaînes de user-agent différentes, si bien qu'une règle définie sous l'un n'affecte pas l'autre. Pour que Googlebot et Bingbot continuent d'indexer votre site tout en écartant les robots IA, laissez User-agent: * en Allow, puis ajoutez des groupes distincts avec Disallow: / pour des agents comme GPTBot, ChatGPT-User, Google-Extended, anthropic-ai, ClaudeBot, CCBot, PerplexityBot et Bytespider. Comme c'est le groupe correspondant le plus spécifique qui l'emporte, chaque robot nommé suit son propre blocage tandis que les moteurs de recherche restent soumis à la règle par défaut permissive. Notez que le respect de ces règles est volontaire — les robots bien élevés honorent robots.txt, mais ce n'est pas une barrière de sécurité. Ce testeur inclut un préréglage Bloquer les robots IA et permet de simuler chaque crawler individuellement pour confirmer que les moteurs de recherche restent autorisés pendant que les robots IA sont bloqués.

Pourquoi mon robots.txt est-il ignoré ou ne fonctionne-t-il pas ?

La raison la plus courante est l'emplacement : un fichier robots.txt doit se trouver à la racine de l'hôte qu'il régit, exactement à /robots.txt, et les règles s'appliquent par protocole, sous-domaine et port. Un fichier situé dans /dossier/robots.txt ou sur le domaine racine ne contrôlera pas un sous-domaine. Parmi les autres échecs silencieux : des lignes Allow ou Disallow placées avant toute ligne User-agent (les crawlers les ignorent), des groupes de user-agent en double qui fusionnent de façon inattendue, une règle Allow inatteignable masquée par un Disallow plus spécifique, et l'absence d'un groupe par défaut User-agent: *. Des fautes de frappe dans les noms de directives et des valeurs négatives de Crawl-delay sont également souvent écartées silencieusement. Ce testeur analyse l'intégralité de votre fichier, signale ces problèmes structurels avec les numéros de ligne, et nomme la directive exacte qui décide du sort de chaque URL, afin que vous puissiez identifier pourquoi une règle ne se comporte pas comme prévu.

Le Crawl-delay dans robots.txt ralentit-il réellement Googlebot ?

Non — Google ne prend pas en charge la directive Crawl-delay et l'ignore entièrement, donc l'ajouter ne changera pas la vitesse à laquelle Googlebot demande vos pages. Pour ajuster la vitesse d'exploration de Google, vous dépendez de son exploration adaptative automatique, qui réagit à la vitesse de votre serveur et à ses réponses d'erreur. Crawl-delay est en revanche respecté par certains autres crawlers, dont Bingbot et Yandex, où il fixe le nombre minimal de secondes qu'un robot attend entre deux requêtes. Une valeur négative est invalide et est écartée. Comme la prise en charge varie selon le moteur, il vaut la peine de vérifier quel crawler lit la directive et quelle valeur s'applique à lui. Ce testeur affiche la valeur de Crawl-delay pour le user-agent que vous sélectionnez, l'analyse dans votre fichier et vous alerte en cas de valeurs négatives invalides, afin que vous voyiez d'un coup d'œil quels robots votre délai affecte réellement.

À propos du Testeur de Robots.txt

Le Testeur de Robots.txt est un outil gratuit qui montre exactement comment un moteur de recherche ou un robot d'IA va lire vos règles robots.txt. Collez le contenu d'un fichier robots.txt, choisissez un crawler et saisissez une URL — l'outil affiche instantanément un verdict AUTORISÉ ou BLOQUÉ, indique la directive qui a tranché et pointe vers le numéro de ligne concerné. Il s'adresse aux SEOs, développeurs et propriétaires de sites qui doivent vérifier que leurs pages importantes restent explorables et que les chemins d'administration, les URLs de recherche à facettes ou les robots d'entraînement IA sont bien tenus à l'écart.

Un fichier robots.txt est un fichier texte brut placé à la racine d'un domaine (/robots.txt) qui indique aux crawlers quels chemins ils peuvent ou non demander. Il contrôle l'exploration, pas l'indexation — une URL bloquée peut malgré tout apparaître dans les résultats de recherche si d'autres pages y font un lien — un comportement subtil que ce testeur vous aide justement à anticiper avant de mettre en production un changement.

Tout se passe localement dans votre navigateur. Le robots.txt que vous collez et les URLs que vous testez ne sont jamais envoyés à un serveur : vous pouvez donc vérifier en toute sécurité les règles d'un site de préproduction pas encore publié. Aucune inscription, aucune limite d'usage, et vous pouvez copier ou télécharger le fichier sur lequel vous travaillez sous forme de robots.txt.

Comment fonctionne la vérification autorisé/bloqué

L'outil applique l'algorithme de correspondance de Google, si bien que le verdict reflète le comportement réel de Googlebot et de la plupart des crawlers modernes :

  • La règle la plus spécifique l'emporte. Lorsque plusieurs lignes Allow et Disallow correspondent à une URL, celle dont le chemin est le plus long (jokers ignorés) a priorité.
  • En cas d'égalité, Allow bat Disallow. Si un Allow et un Disallow sont tout aussi spécifiques, l'URL est autorisée.
  • Les jokers sont pris en charge. * correspond à n'importe quelle suite de caractères et $ ancre la correspondance à la fin de l'URL — ainsi Disallow: /*.pdf$ bloque spécifiquement les fichiers PDF.
  • Les groupes de user-agent spécifiques priment sur le groupe *. Si le crawler que vous sélectionnez possède son propre bloc de règles, l'outil l'utilise à la place des règles génériques.

Vous pouvez tester une URL à la fois ou basculer vers l'onglet Test en masse, coller de nombreuses URLs (une par ligne), et obtenir un verdict par URL ainsi qu'un décompte récapitulatif du nombre d'URLs autorisées et bloquées.

Crawlers que vous pouvez simuler

L'outil embarque les user-agents qui comptent le plus aujourd'hui, notamment Googlebot, Googlebot-Image, Bingbot, Applebot, DuckDuckBot, Yandex et Baiduspider — ainsi que des robots d'IA comme GPTBot et ChatGPT-User. Vous pouvez également saisir n'importe quelle chaîne de user-agent personnalisée. Cela permet de vérifier facilement que vous laissez entrer les moteurs de recherche tout en bloquant les robots d'entraînement IA, un objectif courant couvert par le préréglage intégré « Bloquer les robots IA ».

Validation, règles analysées et préréglages

Au-delà du verdict, l'outil analyse l'intégralité de votre fichier et signale les problèmes qui cassent discrètement l'exploration :

  • L'absence d'un groupe par défaut User-agent: *.
  • Des groupes de user-agent en double qui sont fusionnés.
  • Des lignes Allow ou Disallow placées avant toute ligne User-agent, et donc ignorées.
  • Des directives invalides ou non reconnues, ainsi que des valeurs négatives de Crawl-delay.
  • Des règles Allow potentiellement inatteignables car masquées par un Disallow plus spécifique.

L'outil liste également chaque groupe analysé, indique quelles directives s'appliquent au crawler sélectionné, fait ressortir les entrées Sitemap et Host éventuelles, et affiche le Crawl-delay propre à ce robot. Pour démarrer rapidement, chargez un préréglage — Tout autoriser, Tout bloquer, Bloquer les robots IA, WordPress standard, ou un fichier complexe façon Google avec plusieurs groupes, jokers et ancrages — puis modifiez-le pour l'adapter à votre propre site et retestez-le.

Collez votre robots.txt ci-dessus, choisissez un crawler et testez une URL pour voir le verdict ainsi que la règle exacte à son origine.