FERRAMENTA GRÁTIS · GERADOR DE TAG META ROBOTS
Gerador de tag meta robots
Monte a tag meta robots, os cabeçalhos X-Robots-Tag correspondentes e o bloco de robots.txt para rastreadores de IA — e veja a regra que de fato chega a cada rastreador. Quase nunca é a que os geradores prometem.
Também emEnglish繁體中文日本語한국어EspañolFrançaisDeutschPortuguês (Brasil)
index não é uma regra do Google — uma página sem tag robots já é indexável. Só noindex muda alguma coisa.
0 significa nenhum trecho; -1 deixa o Google escolher. Vale também para as Visões gerais de IA e o modo IA.
0 permite apenas uma imagem estática; -1 significa sem limite.
Depois dessa data a página sai dos resultados e o Googlebot passa a rastreá-la bem menos.
agente: regra, regra. Elas se somam às regras acima; não conseguem cancelar nada.
São tokens de robots.txt, não diretivas meta — por isso este campo escreve um bloco de robots.txt, não uma tag.
Tudo acontece dentro desta página. Nada do que você digita é enviado a lugar nenhum.
Como montar uma tag meta robots que faz o que você quis dizer
Escolha as restrições, acrescente exceções por rastreador se tiver, e leia a regra efetiva. Três das verificações existem porque as ferramentas que rankeiam para esta busca erram a semântica, não a sintaxe.
- Decida o que vai restringir. Só restrições contam. Não existe regra «index» na lista do Google, e «all» não tem efeito quando é listado explicitamente: uma página que você quer indexada não precisa de tag nenhuma.
- Diga se o robots.txt bloqueia a URL. Se bloqueia e você pediu noindex, o gerador para. Uma página bloqueada nunca é baixada, então o noindex nunca é lido — o motivo mais comum de uma página se recusar a sair do índice.
- Escreva as linhas por rastreador apenas como restrição. As regras se combinam como a soma das regras negativas. Uma tag específica pode apertar o que vale para aquele rastreador; ela não afrouxa nada.
- Use a versão em cabeçalho para o que não é HTML. PDFs, imagens, CSVs e downloads gerados não têm head onde colocar uma tag. O X-Robots-Tag leva as mesmas regras como cabeçalho de resposta, com trechos para Apache e nginx.
- Rastreadores de IA se resolvem no robots.txt, não aqui. Todo opt-out publicado por Google, OpenAI, Anthropic, Perplexity, Apple, Meta e Common Crawl é um token de user-agent de robots.txt. A terceira saída é esse bloco.
noindex e Disallow se anulam
Um gerador de tag meta robots monta a tag <meta name="robots"> que diz aos buscadores se uma página deve ser indexada, se os links dela devem ser seguidos e quanto dela pode ser exibido. O erro mais caro que ele pode ajudar você a cometer não é um erro de digitação. É combinar essa tag com uma linha Disallow.
Nas palavras do Google: para a regra noindex ser efetiva, a página não pode estar bloqueada por um arquivo robots.txt e precisa estar acessível ao rastreador. Se estiver bloqueada, o rastreador nunca vê a regra, e a URL ainda pode aparecer nos resultados a partir de links que apontam para ela — sem trecho e sem o título que você escolheu.
É nesse laço que as pessoas ficam presas. A página não sai do índice, então bloqueiam também no robots.txt, o que garante que ela nunca saia. E o atalho óbvio também está fechado: especificar noindex no robots.txt não é suportado pelo Google. A ordem é sempre a mesma:
- Tirar a linha
Disallowpara que a página possa ser rastreada. - Servir
noindex— como tag meta no HTML, comoX-Robots-Tagem todo o resto. - Esperar um novo rastreamento. Só depois de a página sair do índice é que bloquear o rastreamento faz sentido — e aí, em geral, já não é preciso.
A caixa de seleção do formulário existe para o gerador poder recusar. Nenhuma das duas ferramentas hoje em primeiro e sexto lugar para esta busca menciona Disallow em ponto algum da página.
«Evitar que mecanismos de busca indexem este site» — e por que o WordPress mudou de lado
Se você chegou aqui procurando por que uma página não aparece no Google, existe uma chance grande de a origem ser uma única caixinha em Configurações → Leitura: «Evitar que mecanismos de busca indexem este site». Vale conhecer a história dela, porque é a melhor prova de tudo que está escrito acima — e ela vem do próprio WordPress.
- Antes da versão 5.3, marcar essa caixa fazia o WordPress escrever
Disallow: /no robots.txt virtual do site. - A partir da 5.3, o WordPress abandonou o caminho do robots.txt e passou a emitir
<meta name="robots" content="noindex,nofollow">. O motivo declarado é exatamente o desta página: bloquear o rastreamento impedia a visita, mas não impedia com segurança que as URLs aparecessem nos resultados.
Três consequências práticas para quem administra um site em português:
- Em uma instalação atual, essa caixa marcada é um
noindexno site inteiro — não um problema de robots.txt. Desmarcar e esperar o recrawl é o conserto; mexer no robots.txt não é. - O pior estado possível é o híbrido: a caixa marcada (noindex) mais um
Disallow: /deixado por um plugin, por uma migração de homologação ou por um robots.txt escrito à mão. Aí o noindex existe e nunca é lido. É a combinação que o campo «Esta URL está bloqueada por uma linha Disallow» acima existe para pegar. - «Cabe aos buscadores respeitar o pedido» — o próprio WordPress avisa isso na tela. A tag é um pedido, não um bloqueio de acesso; para impedir o acesso mesmo, o caminho é autenticação, não uma diretiva.
Se o seu site é WordPress, confira a caixa antes de gerar qualquer tag aqui: se ela estiver marcada, o que você colar no tema vai brigar com o que o núcleo já está emitindo.
Regras por rastreador se somam — elas não substituem
Você pode falar com um rastreador pelo nome: <meta name="googlebot">, <meta name="googlebot-news">, <meta name="bingbot">. O que quase toda explicação inverte é como isso se combina com a tag genérica.
A documentação do Google: quando vários rastreadores são especificados com regras diferentes, o buscador usa a soma das regras negativas. O exemplo dado é um nofollow genérico mais um noindex para o Googlebot, e o resultado para o Googlebot é noindex, nofollow — os dois, não o mais específico. Para cabeçalhos, o mesmo princípio: havendo conflito, vale a regra mais restritiva.
Ou seja, esta dupla não faz o que parece fazer:
<meta name="robots" content="noindex">
<meta name="googlebot" content="index"> <!-- não devolve a página ao índice -->
Não existe regra positiva que desfaça uma negativa. Para ser indexado pelo Google e por mais ninguém, você restringe os outros; não libera o Google. O gerador calcula a regra efetiva para cada rastreador que você nomear e avisa sempre que uma linha tenta afrouxar em vez de apertar.
Mais uma consequência, barata de dizer e fácil de esquecer: nosnippet e max-snippet:50 na mesma página resultam em nenhum trecho, porque a regra mais restritiva ganha.
Diretivas que não fazem mais nada
O Google publica uma lista de regras que não usa, e os geradores continuam oferecendo essas regras sem uma nota. Conferido em 2026-09-15 contra a especificação das tags meta robots:
| Regra | Situação |
|---|---|
noarchive | Não é mais usada pela Busca do Google — ela controlava o link de cache, e esse recurso deixou de existir. |
nocache | Não é usada pela Busca do Google. |
nositelinkssearchbox | Não é mais usada — a caixa de busca de sitelinks que ela suprimia não existe mais. |
index, follow | Não estão na lista de regras válidas do Google. O valor documentado para «sem restrições» é all, e all não tem efeito quando é listado explicitamente. |
A ferramenta em primeiro lugar para esta busca oferece noarchive e nositelinkssearchbox como diretivas que funcionam, sem ressalva. Este gerador ainda emite noarchive se você pedir — outros buscadores podem ler — mas diz que o Google não vai agir sobre ela. E marca uma tag index, follow pelo que ela é: uma tag que não muda nada, em uma página que já era indexável.
Daí sai uma regra prática. Publique uma tag robots só quando estiver restringindo alguma coisa. Se não há nada a restringir, a melhor tag é nenhuma tag.
Rastreadores de IA: a chave está no robots.txt, não em uma tag meta
Circula bastante conselho sugerindo <meta name="noai">, ou colocar Google-Extended em uma tag meta. Fomos ler a documentação de cada fornecedor. Nenhum dos dois funciona, e a forma real é esta.
- Google-Extended não tem nenhuma string de user-agent. A documentação de rastreadores do Google diz que o rastreamento é feito com os user-agents existentes do Google e que o token é usado apenas com função de controle no robots.txt. Não há nada a que uma tag meta possa se dirigir. Ele governa o treinamento e o grounding do Gemini, e não afeta a Busca do Google nem o ranqueamento.
- OpenAI, Anthropic e Perplexity documentam todos tokens de robots.txt —
GPTBot,OAI-SearchBot,ChatGPT-User;ClaudeBot,Claude-SearchBot,Claude-User;PerplexityBot,Perplexity-User. Nenhum dos três documenta uma tag meta. noaienoimageainão aparecem em nenhum desses documentos. São uma proposta do lado dos publishers, não algo que um buscador grande declare respeitar.- Buscas disparadas por uma pessoa são outra categoria. A Perplexity documenta que o
Perplexity-Userem geral ignora o robots.txt porque alguém pediu aquela busca; a Meta diz o mesmo doMeta-ExternalFetcher. Para esses, uma linha de robots.txt não é um muro.
Duas coisas do lado meta realmente alcançam as respostas de IA, e as duas são diretivas comuns do Google: nosnippet e max-snippet se aplicam explicitamente às Visões gerais de IA e ao modo IA, e limitam quanto da página pode servir de entrada direta. Essa é a lista honesta.
A terceira saída escreve o bloco de robots.txt conforme a política que você escolher, agrupado por fornecedor. Bloquear os rastreadores do lado das respostas é uma decisão real com custo real — tira você dos resultados que esses motores citam. Se o objetivo for o contrário, o material está em ferramentas GEO, agrupadas pelo que realmente fazem.
Perguntas frequentes
O que é um gerador de tag meta robots?
Um gerador de tag meta robots monta a tag meta name="robots" que diz aos buscadores se uma página deve ser indexada, se os links dela devem ser seguidos e quanto dela pode ser exibido. Este também emite os cabeçalhos X-Robots-Tag equivalentes e o bloco de robots.txt para rastreadores de IA, e calcula a regra efetiva para cada rastreador que você nomear.
Posso usar noindex e Disallow no robots.txt ao mesmo tempo?
Não — eles se anulam. O Google afirma que, para a regra noindex ser efetiva, a página não pode estar bloqueada pelo robots.txt; uma página bloqueada nunca é baixada, então a regra nunca é lida, e a URL ainda pode aparecer nos resultados por meio de links. Libere o rastreamento, sirva noindex e espere o novo rastreamento.
Marquei «Evitar que mecanismos de busca indexem este site» no WordPress. O que isso faz hoje?
Em versões a partir da 5.3, o WordPress emite uma tag meta robots com noindex,nofollow no site inteiro em vez de escrever Disallow: / no robots.txt — a mudança foi feita justamente porque o caminho do robots.txt não mantinha as páginas fora dos resultados. Desmarque a caixa e espere o recrawl; não é um problema de robots.txt.
Uma tag para googlebot substitui a tag robots genérica?
Não na direção que se espera. O Google usa a soma das regras negativas entre a tag genérica e a específica do rastreador, e havendo conflito vale a mais restritiva. Uma tag específica pode apertar as regras para aquele rastreador; ela não consegue liberar de novo o que a genérica proibiu.
Preciso de uma tag index, follow?
Não. Nem index nem follow estão na lista de regras válidas do Google, e o valor documentado para «sem restrições», all, explicitamente não tem efeito quando é listado. Uma página sem nenhuma tag meta robots já é totalmente indexável, então a tag só vale a pena quando restringe alguma coisa.
noarchive ainda funciona?
Para a Busca do Google, não. Está na lista de regras históricas e sem uso, ao lado de nocache e nositelinkssearchbox, porque o link de cache que ela controlava deixou de existir. Outros buscadores podem ainda ler, então este gerador a emite quando você pede, avisando que o Google não vai agir sobre ela.
Quando usar X-Robots-Tag em vez da tag meta?
Sempre que o recurso não tiver head HTML — PDFs, imagens, arquivos de vídeo, CSVs, downloads gerados. Qualquer regra válida em uma tag meta robots vale como cabeçalho X-Robots-Tag, o cabeçalho pode nomear um user-agent antes das regras, e vários cabeçalhos se combinam.
O noindex chegou, ou a página ainda está lá dentro?
Checar o seu próprio domínio não custa nada, e o que ele lê é o veredito do próprio Google: cada página com o status HTTP ao vivo e o estado de indexação, impressões e posição média contra o período anterior, e o tráfego por origem com os motores de IA contados à parte.
$ npm i -g @clize/clize && clize install $ clize seo check --domain seudominio.com.br[ Ferramentas GEO da Clize → ]