GeradoresOnline
Utilidades

Gerador de robots.txt

Monte um arquivo robots.txt básico para o seu site.

Documentação técnica

robots.txt: uma convenção que crawlers educados seguem, não uma trava de acesso

O arquivo robots.txt segue o Robots Exclusion Protocol — uma convenção estabelecida em 1994 e formalizada como RFC 9309 em 2022, quase três décadas depois de já ser amplamente adotada na prática. É importante entender a natureza exata dessa convenção: é um pedido educado, não uma barreira técnica. Nada no protocolo HTTP impede um crawler de ignorar completamente as diretivas de um robots.txt e acessar qualquer URL do site mesmo assim — crawlers de boa-fé (Googlebot, Bingbot e a maioria dos crawlers de SEO legítimos) respeitam o arquivo por convenção da indústria, mas crawlers maliciosos ou mal-comportados simplesmente o ignoram, porque não há mecanismo de enforcement técnico algum.

Por que robots.txt nunca deveria ser a defesa de conteúdo sensível

Uma consequência direta da natureza de "pedido, não barreira": listar um caminho no Disallow de um robots.txt como forma de "esconder" uma URL sensível (um painel administrativo, uma API interna) não oferece proteção nenhuma contra alguém que acesse a URL diretamente — e paradoxalmente, publicar esse caminho no robots.txt (um arquivo público, acessível por qualquer pessoa) é, na prática, um mapa de quais URLs o site considera sensíveis o suficiente para querer ocultar de buscadores, informação que um atacante pode usar diretamente. Controle de acesso real exige autenticação e autorização no servidor, nunca uma diretiva de robots.txt.

Bloquear indexação não é o mesmo que bloquear rastreamento

Outra distinção sutil e frequentemente confundida: Disallow no robots.txt impede o crawler de acessar a URL, mas não garante que ela nunca apareça nos resultados de busca — se outras páginas linkarem para essa URL, o Google pode indexá-la (mostrando só a URL, sem conteúdo, já que não pôde rastreá-la) mesmo tecnicamente "bloqueada". Para garantir que uma página específica nunca apareça na busca, a ferramenta correta é a meta tag <meta name="robots" content="noindex"> na própria página (que exige que o crawler consiga acessá-la para ler essa instrução) — as duas ferramentas resolvem problemas relacionados, mas não intercambiáveis.

Gostou das ferramentas? Ajude a manter o site no ar: apoiar via Pix · Sobre · Contato · Política de Privacidade