robots.txt e sitemap

Gerador de robots.txt e sitemap XML

Monte robots.txt com GPTBot e um sitemap XML simples.

Crawlers de IA
  • GPTBot (treino OpenAI)
  • ChatGPT-User
  • OAI-SearchBot
  • Google-Extended (treino Gemini)
  • ClaudeBot
  • Anthropic-AI
  • PerplexityBot
  • Applebot-Extended
  • Bytespider
  • CCBot
  • Amazonbot
  • meta-externalagent

Resultado

robots.txt

User-agent: *
Disallow:
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Anthropic-AI
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: Bytespider
Allow: /

User-agent: CCBot
Allow: /

User-agent: Amazonbot
Allow: /

User-agent: meta-externalagent
Allow: /

sitemap.xml

<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">

</urlset>

Patrocinado

Hospedagem e WordPress

Ver opções de hospedagemURL de afiliado ainda não configuradaConhecer o WordPressURL de afiliado ainda não configurada

Podemos receber comissão se você contratar por estes links, sem custo extra para você. É uma forma de manter as ferramentas gratuitas.

Este gerador de robots.txt monta um arquivo com User-agent: *, Allow/Disallow, diretivas para crawlers de IA (GPTBot, Google-Extended, ClaudeBot e outros) e a linha Sitemap:. Tudo no navegador, sem varrer o site.

O mesmo ecrã gera um sitemap XML simples a partir de uma lista de URLs. Não descobre páginas sozinho e não valida se as URLs respondem 200.

Permitir ou bloquear GPTBot e pares é política sua. Treino de modelo, busca e fetch de usuário são user-agents diferentes — leia o rótulo antes de marcar Bloquear.

robots.txt é um recado, não um cadeado. URLs sensíveis precisam de autenticação de verdade, não só de Disallow.

Nenhuma URL da lista é visitada. O gerador só formata robots.txt e o XML com o que você cola.

Boas práticas rápidas

  • Apontar Sitemap: para o XML canônico (um arquivo ou um sitemap index).
  • Não bloqueie CSS e JS necessários para o Google renderizar a página.
  • Separe GPTBot (treino) de user-agents de busca/fetch se a política for diferente.
  • Depois de publicar, teste o arquivo em https://seusite.com/robots.txt e no Search Console.

Perguntas frequentes

Respostas sobre robots.txt, GPTBot, a linha Sitemap: e o XML gerado nesta página.

O que este gerador inclui além do User-agent: *?
Blocos para crawlers de IA — GPTBot, ChatGPT-User, OAI-SearchBot, Google-Extended, ClaudeBot, Anthropic-AI, PerplexityBot, Applebot-Extended, Bytespider, CCBot, Amazonbot e meta-externalagent — mais a linha Sitemap: se você preencher a URL.
A ferramenta rastreia o site para montar o sitemap?
Não. Você cola as URLs. O XML é um urlset mínimo com loc e lastmod do dia. Sem crawler e sem lastmod detectado na página.
Bloquear GPTBot esconde o conteúdo do ChatGPT?
Não necessariamente. GPTBot costuma ser o bot de treino; ChatGPT-User e OAI-SearchBot são agentes distintos. Ajuste cada linha conforme a política, em vez de assumir um único interruptor.
robots.txt impede que o Google indexe uma URL?
Não é garantia. Disallow pede para não rastrear. URLs ainda podem ser indexadas se houver links. Use noindex ou autenticação quando a URL não deve aparecer.
Posso ter vários arquivos Sitemap: ?
O campo desta página emite uma linha. Se você tiver um índice de sitemaps, aponte para ele. Várias linhas Sitemap: também são válidas — edite o texto copiado se precisar.
Os caminhos que eu colo são enviados a um servidor?
Não. O texto fica no navegador até recarregar. Copie robots.txt e o XML para o seu host.

Cookies e anúncios

Usamos cookies e, quando configurado, anúncios para manter o kit gratuito. Ao continuar, você reconhece o uso de cookies e de espaços publicitários nesta sessão. Política de privacidade