OUTIL GRATUIT · GÉNÉRATEUR DE BALISE META ROBOTS
Générateur de balise meta robots
Construisez la balise meta robots, les en-têtes X-Robots-Tag correspondants et le bloc robots.txt destiné aux robots d'IA — et lisez la règle réellement appliquée à chaque robot. Ce n'est pas celle que la plupart des générateurs vous promettent.
Aussi enEnglish繁體中文日本語한국어EspañolFrançaisDeutschPortuguês (Brasil)
index n'est pas une règle Google — une page sans balise robots est déjà indexable. Seul noindex change quelque chose.
0 signifie aucun extrait ; -1 laisse Google choisir. S'applique aussi aux aperçus IA et au mode IA.
0 n'autorise qu'une image fixe ; -1 signifie aucune limite.
Après cette date, la page sort des résultats et Googlebot l'explore beaucoup moins souvent.
agent: règle, règle. Elles s'ajoutent aux règles ci-dessus ; elles ne peuvent rien annuler.
Ce sont des jetons robots.txt, pas des directives meta — ce champ écrit donc un bloc robots.txt, pas une balise.
Tout s'exécute dans cette page. Rien de ce que vous saisissez n'est envoyé où que ce soit.
Construire une balise meta robots qui fait ce que vous vouliez
Choisissez les restrictions, ajoutez les exceptions par robot si vous en avez, et lisez la règle effective. Trois des contrôles existent parce que les outils positionnés sur cette requête se trompent sur la sémantique, pas sur la syntaxe.
- Décidez ce que vous restreignez. Seules les restrictions comptent. Il n'existe pas de règle « index » dans la liste de Google, et « all » n'a aucun effet lorsqu'il est explicitement listé : une page que vous voulez indexée n'a besoin d'aucune balise.
- Indiquez si le robots.txt bloque l'URL. Si c'est le cas et que vous demandez noindex, le générateur s'arrête. Une page bloquée n'est jamais récupérée, donc le noindex n'est jamais lu — la raison la plus fréquente pour laquelle une page refuse de quitter l'index.
- N'écrivez les lignes par robot que comme des restrictions. Les règles se combinent comme la somme des règles négatives. Une balise propre à un robot peut resserrer ce qui s'applique à lui ; elle ne peut rien desserrer.
- Prenez la version en-tête pour tout ce qui n'est pas du HTML. PDF, images, CSV et téléchargements générés n'ont pas de head où poser une balise. X-Robots-Tag transporte les mêmes règles en en-tête de réponse, avec les extraits Apache et nginx fournis.
- Traitez les robots d'IA dans le robots.txt, pas ici. Chaque opt-out publié par Google, OpenAI, Anthropic, Perplexity, Apple, Meta et Common Crawl est un jeton user-agent de robots.txt. La troisième sortie est ce bloc.
noindex et Disallow s'annulent mutuellement
Un générateur de balise meta robots construit la balise <meta name="robots"> qui indique aux moteurs de recherche si une page doit être indexée, si ses liens doivent être suivis, et jusqu'où l'afficher. L'erreur la plus coûteuse qu'il peut vous aider à commettre n'est pas une faute de frappe. C'est de combiner cette balise avec une ligne Disallow.
La formulation de Google : pour que la règle noindex soit effective, la page ne doit pas être bloquée par un fichier robots.txt et doit rester accessible au robot d'exploration. Si elle est bloquée, le robot ne voit jamais la règle, et l'URL peut continuer d'apparaître dans les résultats à partir des liens qui pointent vers elle — sans extrait et sans le titre que vous avez choisi.
C'est la boucle dans laquelle on s'enferme. Une page ne quitte pas l'index, alors on la bloque aussi dans le robots.txt, ce qui garantit qu'elle ne le quittera jamais. Le raccourci évident est fermé lui aussi : indiquer noindex dans le robots.txt n'est pas pris en charge par Google. L'ordre des opérations est toujours le même :
- Retirer la ligne
Disallowpour que la page puisse être explorée. - Servir
noindex— en balise meta sur le HTML, enX-Robots-Tagsur tout le reste. - Attendre une réexploration. Ce n'est qu'une fois la page sortie de l'index que bloquer l'exploration a du sens — et en général ce n'est alors plus nécessaire.
La case à cocher du formulaire existe pour que le générateur puisse refuser. Aucun des deux outils actuellement en première et sixième position sur cette requête ne mentionne Disallow nulle part sur sa page.
Les règles par robot s'additionnent — elles ne remplacent pas
Vous pouvez vous adresser à un robot par son nom : <meta name="googlebot">, <meta name="googlebot-news">, <meta name="bingbot">. Ce que la plupart des explications inversent, c'est la façon dont cela se combine avec la balise générique.
La documentation de Google : lorsque plusieurs robots sont spécifiés avec des règles différentes, le moteur utilise la somme des règles négatives. L'exemple donné associe un nofollow générique à un noindex pour Googlebot, et le résultat pour Googlebot est noindex, nofollow — les deux, pas la plus spécifique. Le même principe est énoncé pour les en-têtes : en cas de règles contradictoires, la plus restrictive s'applique.
Ce couple ne fait donc pas ce dont il a l'air :
<meta name="robots" content="noindex">
<meta name="googlebot" content="index"> <!-- ne réadmet pas la page -->
Aucune règle positive n'annule une règle négative. Pour être indexé par Google et par personne d'autre, vous restreignez les autres ; vous n'autorisez pas Google. Le générateur calcule la règle effective pour chaque robot que vous nommez et avertit dès qu'une ligne cherche à desserrer au lieu de resserrer.
Une conséquence de plus, facile à manquer : nosnippet et max-snippet:50 sur la même page ne produisent aucun extrait, parce que la règle la plus restrictive gagne.
En France, la ligne « par robot » n'est pas un exercice théorique
Sur un site anglophone, nommer un robot autre que Googlebot relève surtout de la curiosité. Sur le marché français, il y a une raison concrète de le faire : Qwant, moteur français lancé en 2013, exploite son propre robot d'exploration — Qwantbot, anciennement Qwantify dans les chaînes user-agent — et son propre index pour le contenu européen, complété par les résultats de Bing pour le reste. Il respecte le robots.txt.
Ce que cela change en pratique :
- Une page peut être hors de l'index Google et présente ailleurs. Les deux index ne sont pas le même objet, et une balise
<meta name="robots" content="noindex">générique est ce qui les couvre tous les deux — c'est précisément pourquoi la balise générique reste le bon défaut. - Nommer un robot ne fait qu'ajouter. Si vous écrivez
qwantbot: noindexdans le champ ci-dessus, le générateur l'ajoute à ce qui s'applique déjà à tous. Il ne peut pas servir à ré-autoriser Qwant sur une page que la balise générique interdit — c'est la règle de la section précédente, appliquée à un cas français. bingbota un poids indirect ici, puisque la couverture hors index propre passe par Bing, et que c'est aussi le côté d'où viennent les réponses de Copilot.
Autrement dit : gardez la balise générique comme source de vérité, et réservez les lignes par robot aux cas où vous voulez être plus strict avec l'un d'eux. Le générateur affiche la règle finale obtenue pour chaque nom que vous saisissez, ce qui évite d'écrire une ligne qui, en France comme ailleurs, ne peut structurellement rien desserrer.
Les directives qui ne font plus rien
Google publie une liste de règles qu'il n'utilise pas, et les générateurs continuent de les proposer sans le préciser. Vérifié le 2026-09-15 contre la spécification des balises meta robots :
| Règle | État |
|---|---|
noarchive | N'est plus utilisée par la recherche Google — elle contrôlait le lien « en cache », qui n'existe plus. |
nocache | N'est pas utilisée par la recherche Google. |
nositelinkssearchbox | N'est plus utilisée — la zone de recherche des liens de site qu'elle supprimait n'existe plus. |
index, follow | Ne figurent pas du tout dans la liste des règles valides de Google. La valeur documentée pour « aucune restriction » est all, et all n'a aucun effet lorsqu'il est explicitement listé. |
L'outil en première position sur cette requête propose noarchive et nositelinkssearchbox comme des directives actives, sans réserve. Ce générateur émettra tout de même noarchive si vous le demandez — d'autres moteurs peuvent encore le lire — mais il vous dit que Google ne le fait pas. Et il signale une balise index, follow pour ce qu'elle est : une balise qui ne change rien, sur une page qui était déjà indexable.
D'où une règle empirique utile. Ne publiez une balise robots que lorsque vous restreignez quelque chose. Si vous n'avez rien à restreindre, la meilleure balise est l'absence de balise.
Robots d'IA : l'interrupteur est dans le robots.txt, pas dans une balise meta
Beaucoup de conseils suggèrent <meta name="noai">, ou de placer Google-Extended dans une balise meta. Nous sommes allés lire la documentation de chaque éditeur. Ni l'un ni l'autre ne fonctionne, et voici la forme réelle du sujet.
- Google-Extended n'a aucune chaîne user-agent. La documentation des robots d'exploration de Google indique que l'exploration est effectuée avec les user-agents Google existants et que le jeton sert uniquement à des fins de contrôle dans le robots.txt. Il n'y a rien qu'une balise meta puisse adresser. Il gouverne l'entraînement et l'ancrage de Gemini, et n'affecte ni la recherche Google ni le classement.
- OpenAI, Anthropic et Perplexity documentent tous des jetons robots.txt —
GPTBot,OAI-SearchBot,ChatGPT-User;ClaudeBot,Claude-SearchBot,Claude-User;PerplexityBot,Perplexity-User. Aucun des trois ne documente de balise meta. noaietnoimageain'apparaissent dans aucun de ces documents. Il s'agit d'une proposition d'éditeurs, pas d'un dispositif qu'un grand moteur déclare honorer.- Les récupérations déclenchées par un utilisateur sont une catégorie à part. Perplexity documente que
Perplexity-Userignore généralement le robots.txt parce qu'une personne a demandé la récupération ; Meta dit la même chose deMeta-ExternalFetcher. Pour ceux-là, une ligne de robots.txt n'est pas un mur.
Deux choses côté meta atteignent réellement les réponses d'IA, et ce sont des directives Google ordinaires : nosnippet et max-snippet s'appliquent explicitement aux aperçus IA et au mode IA, et limitent la part de la page utilisable comme entrée directe. C'est la liste honnête.
La troisième sortie écrit le bloc robots.txt correspondant à la politique que vous choisissez, regroupé par éditeur. Bloquer les robots côté réponse est un vrai choix avec un vrai coût — il vous retire des résultats que ces moteurs citent. Si l'objectif est au contraire d'être cité, la matière est sur les outils GEO, classés par ce qu'ils font vraiment.
FAQ
Qu'est-ce qu'un générateur de balise meta robots ?
Un générateur de balise meta robots construit la balise meta name="robots" qui indique aux moteurs de recherche si une page doit être indexée, si ses liens doivent être suivis, et jusqu'où l'afficher. Celui-ci émet aussi les en-têtes X-Robots-Tag équivalents et le bloc robots.txt pour les robots d'IA, et calcule la règle effective pour chaque robot que vous nommez.
Puis-je utiliser noindex et Disallow dans le robots.txt en même temps ?
Non — ils s'annulent. Google indique que pour qu'une règle noindex soit effective, la page ne doit pas être bloquée par le robots.txt ; une page bloquée n'est jamais récupérée, la règle n'est donc jamais lue, et l'URL peut encore apparaître dans les résultats via des liens. Autorisez l'exploration, servez noindex, attendez une réexploration.
Une balise propre à googlebot remplace-t-elle la balise robots générique ?
Pas dans le sens attendu. Google utilise la somme des règles négatives entre la balise générique et celle propre au robot, et en cas de conflit la plus restrictive s'applique. Une balise ciblée peut resserrer les règles pour ce robot ; elle ne peut pas ré-autoriser ce que la balise générique a interdit.
Dois-je écrire une ligne pour Qwant ?
Seulement si vous voulez être plus strict avec lui. Qwant exploite son propre robot, Qwantbot (anciennement Qwantify dans les user-agents), et son propre index pour le contenu européen, complété par Bing ; il respecte le robots.txt. La balise robots générique le couvre déjà, et une ligne qwantbot ne pourrait de toute façon qu'ajouter une restriction, jamais en lever une.
Ai-je besoin d'une balise index, follow ?
Non. Ni index ni follow ne figurent dans la liste des règles valides de Google, et la valeur documentée pour « aucune restriction », all, n'a explicitement aucun effet lorsqu'elle est listée. Une page sans aucune balise meta robots est entièrement indexable : une balise ne vaut la peine que si elle restreint quelque chose.
noarchive fonctionne-t-il encore ?
Pas pour la recherche Google. Elle figure dans la liste des règles historiques et inutilisées, aux côtés de nocache et nositelinkssearchbox, parce que le lien « en cache » qu'elle contrôlait n'existe plus. D'autres moteurs peuvent encore la lire : ce générateur l'émet sur demande tout en vous disant que Google n'agira pas dessus.
Quand utiliser X-Robots-Tag plutôt que la balise meta ?
Dès que la ressource n'a pas de head HTML — PDF, images, fichiers vidéo, CSV, téléchargements générés. Toute règle valide dans une balise meta robots l'est aussi en en-tête X-Robots-Tag, l'en-tête peut nommer un user-agent avant les règles, et plusieurs en-têtes se combinent.
Le noindex est-il arrivé, ou la page est-elle toujours là ?
Vérifier votre propre domaine ne coûte rien, et cela lit le verdict de Google lui-même : chaque page avec son statut HTTP en direct et son état d'indexation, les impressions et la position moyenne comparées à la période précédente, et le trafic par source avec les moteurs d'IA comptés séparément.
$ npm i -g @clize/clize && clize install $ clize seo check --domain votredomaine.fr[ Outils GEO par Clize → ]