Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)

Os user-agents de IA são as strings de identificação que crawlers de inteligência artificial usam ao acessar websites, e conhecer cada um deles é essencial para qualquer profissional de Generative Engine Optimization (GEO), SEO técnico ou administrador de sistemas que precisa decidir quais crawlers permitir, quais bloquear, e como configurar corretamente o robots.txt em 2026. Segundo dados da Cloudflare divulgados em janeiro de 2026, mais de 50 bilhões de requisições diárias na rede da Cloudflare são feitas por crawlers de IA, representando quase 1% de todo o tráfego web — e a distribuição é heavily skewed: Googlebot alcança 1,70× mais URLs únicas que ClaudeBot, 1,76× mais que GPTBot, 2,99× mais que Meta-ExternalAgent, 3,26× mais que Bingbot, 167× mais que PerplexityBot e 714× mais que CCBot. Na GeoStack, primeira agência especializada em GEO no Brasil, mantemos esta referência atualizada porque decisões sobre permitir ou bloquear cada crawler têm implicações estratégicas concretas: bloquear crawlers de busca em tempo real reduz visibilidade imediata em ChatGPT Search, Perplexity e Google AI Overviews; bloquear crawlers de treinamento afeta aparição em modelos base (ChatGPT, Claude, Gemini) em rodadas futuras de atualização. Este guia apresenta a lista completa, strings exatas, documentação oficial e configurações práticas de robots.txt para cada cenário estratégico.

Como funciona a identificação de crawlers via user-agent

Todo crawler responsável — seguindo o RFC 9309 (Robots Exclusion Protocol) — envia uma string de user-agent em cada requisição HTTP que identifica quem está acessando. O site pode então usar essa informação para:

  • Permitir ou bloquear o crawler via diretivas no robots.txt
  • Aplicar regras específicas em firewalls (Cloudflare, WAFs)
  • Identificar padrões de acesso em logs de servidor
  • Medir quem está consumindo conteúdo e como

É importante notar duas limitações centrais: (1) robots.txt é mecanismo opt-in — crawlers escolhem respeitá-lo; alguns não respeitam (historicamente, Perplexity foi criticada por ignorar diretivas, e outras empresas já foram flagradas em práticas semelhantes); (2) user-agents podem ser spoofados — qualquer pessoa com curl pode fingir ser GPTBot em minutos. Para identificação confiável, verificação por IP ranges publicados oficialmente é mais robusta que verificação apenas por user-agent.

Em análises da HUMAN Security publicadas em 2026, cerca de 5,7% das requisições que apresentam user-agent de crawlers de IA conhecidos foram identificadas como spoofadas. Esse fator torna a verificação de IP importante para decisões críticas.

Para aprofundar conceitos relacionados, consulte os Estudos de GEO, o Glossário de GEO e o estudo comparativo GEO x SEO.

As três categorias de crawlers de IA

Para decidir estratégia de permissão/bloqueio, é crucial distinguir entre três categorias:

1. Crawlers de treinamento (Training Crawlers)

Coletam dados para treinar futuras versões de modelos. Bloqueá-los não afeta visibilidade imediata em IAs com busca em tempo real, mas pode excluir seu conteúdo de rodadas futuras de treinamento. Decisão estratégica de longo prazo.

Exemplos: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google), Applebot-Extended (Apple), CCBot (Common Crawl).

2. Crawlers de busca/recuperação em tempo real (Search/Retrieval Crawlers)

Alimentam funcionalidades de busca em tempo real nos assistentes de IA. Bloqueá-los impacta diretamente aparições em ChatGPT Search, Perplexity, Gemini com Grounding, Google AI Overviews. Crítico para visibilidade imediata.

Exemplos: OAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity), Bingbot (Microsoft), Google-Extended também atua em parte desse escopo.

Diagnóstico Gratuito

Sua marca aparece quando a IA responde?

Descubra em um relatório gratuito como ChatGPT, Gemini, Perplexity, Claude, Copilot e Google AI Overviews enxergam (ou ignoram) sua marca hoje.

Solicitar Auditoria Grátis Sem compromisso. Sem cartão. Só dados.

3. Crawlers invocados por usuário (User-triggered Crawlers)

Ativados quando um usuário específico solicita acesso a uma URL. Não fazem crawl massivo; respondem a pedidos pontuais. Tipicamente recomenda-se permitir acesso.

Exemplos: ChatGPT-User (OpenAI), Claude-User (Anthropic), Perplexity-User (Perplexity).

Lista completa: OpenAI (ChatGPT)

A OpenAI opera três crawlers distintos, documentados oficialmente em platform.openai.com/docs/bots:

GPTBot

Categoria: treinamento
Propósito: coleta de dados para treinar futuros modelos da OpenAI
String user-agent: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)
Identificar em logs: buscar GPTBot
Respeita robots.txt: sim
Documentação: platform.openai.com/docs/gptbot
Implicação de bloqueio: impede uso em treinamento futuro; não afeta ChatGPT Search atual

OAI-SearchBot

Categoria: busca em tempo real
Propósito: indexar conteúdo usado nos resultados do ChatGPT Search
String user-agent: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)
Identificar em logs: buscar OAI-SearchBot
Respeita robots.txt: sim
Implicação de bloqueio: impede aparição em ChatGPT Search. Permitir é requisito para visibilidade

ChatGPT-User

Categoria: invocado por usuário
Propósito: acessar URL específica quando usuário do ChatGPT solicita no chat
String user-agent: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ChatGPT-User/1.0; +https://openai.com/bot)
Identificar em logs: buscar ChatGPT-User
Respeita robots.txt: sim
Implicação de bloqueio: impede que usuários acessem seu conteúdo via ChatGPT quando solicitam explicitamente

OpenAI confirma publicamente que não treina com dados coletados via ChatGPT-User ou OAI-SearchBot — apenas via GPTBot. Isso permite controle granular: bloquear GPTBot (opt-out de treinamento) mantendo OAI-SearchBot e ChatGPT-User (opt-in de visibilidade).

Lista completa: Anthropic (Claude)

A Anthropic documenta oficialmente em docs.anthropic.com e em support.anthropic.com:

ClaudeBot

Categoria: treinamento
Propósito: coleta de dados para treinar modelos Claude
String user-agent: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; [email protected])
Identificar em logs: buscar ClaudeBot
Respeita robots.txt: sim (Anthropic confirmou em 2024-2025)
Implicação de bloqueio: impede uso de conteúdo em treinamento de modelos Claude

Claude-SearchBot

Categoria: busca em tempo real
Propósito: retrievals para respostas do Claude
Identificar em logs: buscar Claude-SearchBot
Respeita robots.txt: sim
Implicação de bloqueio: impede aparição em respostas do Claude com busca ativa

Claude-User (anteriormente claude-web)

Categoria: invocado por usuário
Propósito: acesso a URL específica quando usuário solicita
Identificar em logs: buscar Claude-User ou claude-web (este último é legado)
Respeita robots.txt: sim

anthropic-ai (legado)

Status: depreciado em julho de 2024 em favor de ClaudeBot
Identificar em logs: anthropic-ai (tráfego observável hoje é quase certamente legado ou spoofado)

Lista completa: Perplexity

Perplexity documenta em docs.perplexity.ai/guides/bots:

PerplexityBot

Categoria: busca/indexação
Propósito: indexar conteúdo para respostas e citações do Perplexity
String user-agent: Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)
Identificar em logs: buscar PerplexityBot
Respeita robots.txt: oficialmente sim (houve controvérsias em 2024 sobre bypass; a empresa publicou IP ranges oficiais)
Implicação de bloqueio: impede aparição como fonte citada no Perplexity

Perplexity-User

Categoria: invocado por usuário
Propósito: acesso iniciado por usuário durante conversa
Identificar em logs: buscar Perplexity-User
Respeita robots.txt: sim

Perplexity declara publicamente que não treina modelos próprios com dados coletados — usa modelos de terceiros (OpenAI, Anthropic, Meta). Portanto, bloqueio por receio de treinamento é menos relevante que para OpenAI ou Anthropic.

Lista completa: Google (Gemini e AI Overviews)

Google documenta oficialmente em developers.google.com/search/docs/crawling-indexing/overview-google-crawlers:

Google-Extended

Categoria: treinamento + retrieval para IA
Propósito: controla uso de conteúdo para Gemini, Vertex AI, treinamento de modelos Google
Identificar em logs: buscar Google-Extended
Respeita robots.txt: sim
Implicação de bloqueio: impede uso em Gemini e modelos Google; AI Overviews do Google continua usando outros sinais via Googlebot

Googlebot

Categoria: busca tradicional + base para AI Overviews/AI Mode
Propósito: indexação para Search, alimenta também AI Overviews e AI Mode
Identificar em logs: buscar Googlebot
Respeita robots.txt: sim
Nota crítica: bloquear Googlebot significa sair do Google completamente. Raramente faz sentido.

Google-NotebookLM

Categoria: invocado por usuário
Propósito: busca URLs que usuários do NotebookLM adicionam como fontes
Identificar em logs: buscar Google-NotebookLM

Google-CloudVertexBot

Categoria: treinamento empresarial (Vertex AI)
Identificar em logs: buscar Google-CloudVertexBot

Google-Read-Aloud

Categoria: serviço específico (leitura em voz alta)
Identificar em logs: buscar Google-Read-Aloud

GoogleOther

Categoria: variados propósitos internos Google
Identificar em logs: GoogleOther

Lista completa: Microsoft (Bing e Copilot)

Bingbot

Categoria: busca tradicional + alimentação de Copilot/Bing Chat
Propósito: indexação Bing e alimentação de funcionalidades de IA Microsoft
String user-agent: Mozilla/5.0 (compatible; bingbot/2.0; +http://www.bing.com/bingbot.htm)
Identificar em logs: buscar bingbot (minúsculas)
Respeita robots.txt: sim
Documentação: bing.com/webmasters
Nota: bloquear Bingbot impacta Copilot, Bing Chat e ChatGPT Search (que usa Bing como backbone em parte)

Lista completa: Apple (Apple Intelligence)

Applebot

Categoria: busca (Siri, Spotlight)
Propósito: indexação para funcionalidades Apple de busca
Identificar em logs: buscar Applebot
Respeita robots.txt: sim
Documentação: support.apple.com

Applebot-Extended

Categoria: treinamento de IA (Apple Intelligence)
Propósito: controla uso de conteúdo para modelos Apple Intelligence
Identificar em logs: buscar Applebot-Extended
Respeita robots.txt: sim
Implicação de bloqueio: impede uso em Apple Intelligence; Applebot para busca não é afetado

Lista completa: Meta (Llama, Meta AI)

Meta-ExternalAgent

Categoria: treinamento + retrieval
Propósito: coleta de dados para modelos Meta (Llama) e Meta AI
Identificar em logs: buscar meta-externalagent ou Meta-ExternalAgent
Respeita robots.txt: sim
Documentação: developers.facebook.com/docs/sharing/webmasters/web-crawlers

Meta-ExternalFetcher

Categoria: fetch on-demand
Identificar em logs: Meta-ExternalFetcher

FacebookBot

Categoria: indexação específica
Identificar em logs: FacebookBot

facebookexternalhit

Categoria: geração de previews de links
Identificar em logs: facebookexternalhit
Nota: bloquear quebra previews quando links são compartilhados no Facebook/Messenger

Lista completa: Amazon

Amazonbot

Categoria: treinamento + retrieval (Alexa, produtos Amazon AI)
Propósito: alimentar funcionalidades de IA da Amazon
Identificar em logs: buscar Amazonbot
Respeita robots.txt: sim
Documentação: developer.amazon.com/support/amazonbot

Lista completa: Common Crawl

CCBot

Categoria: crawl aberto (alimenta múltiplos LLMs indiretamente)
Propósito: Common Crawl, projeto sem fins lucrativos; dados usados em treinamentos de modelos por várias empresas
String user-agent: Mozilla/5.0 (compatible; CCBot/2.0; +https://commoncrawl.org/faq/)
Identificar em logs: buscar CCBot
Respeita robots.txt: sim
Nota estratégica: Common Crawl em si não treina modelos, mas seu dataset é usado por OpenAI, Meta, Google e outros. Bloquear CCBot reduz indiretamente presença em muitos modelos

Lista completa: outros crawlers relevantes

ByteDance (TikTok/Doubao)

Bytespider
Categoria: treinamento para modelos ByteDance (Doubao, TikTok AI)
Respeita robots.txt: historicamente questionável — observações de mercado sugerem que Bytespider acessou paths bloqueados em parte dos sites monitorados. Tratar com cautela

Cohere

cohere-ai
Categoria: treinamento para modelos Cohere
Identificar em logs: cohere-ai

Mistral AI

MistralAI-User
Categoria: invocado por usuário
Identificar em logs: MistralAI-User

DuckDuckGo (DuckAssist)

DuckAssistBot
Categoria: IA de busca DuckDuckGo
Identificar em logs: DuckAssistBot

Diffbot

Diffbot
Categoria: web scraping estruturado (usado por múltiplos serviços de IA)
Identificar em logs: Diffbot

Cloudflare

Cloudflare-AI-Bot (quando ativado)
Categoria: depende do produto
Documentação: developers.cloudflare.com/bots

You.com

YouBot
Categoria: busca + IA You.com
Identificar em logs: YouBot

LinkedIn

LinkedInBot
Categoria: indexação LinkedIn (inclui funcionalidades de IA)
Identificar em logs: LinkedInBot

Agent Browsers

Novos agentes autônomos emergindo em 2026:

  • OpenAI Operator — user-agent variável, frequentemente ChatGPT-User
  • Anthropic Computer Use / Claude para Chrome
  • Google Project Mariner

Esses agentes executam ações (não apenas coletam dados). Comportamento de robots.txt varia.

Robots.txt: configurações por cenário estratégico

Cenário 1: Visibilidade máxima em IA (recomendação GeoStack padrão)

Para a maioria dos clientes que querem aparecer em todos os LLMs principais:

# Configuração padrão GeoStack: visibilidade máxima em IA

# OpenAI
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

# Anthropic (Claude)
User-agent: ClaudeBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

# Perplexity
User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

# Google
User-agent: Google-Extended
Allow: /

User-agent: Googlebot
Allow: /

# Microsoft
User-agent: bingbot
Allow: /

# Apple
User-agent: Applebot
Allow: /

User-agent: Applebot-Extended
Allow: /

# Meta
User-agent: Meta-ExternalAgent
Allow: /

User-agent: FacebookBot
Allow: /

# Amazon
User-agent: Amazonbot
Allow: /

# Common Crawl (alimenta múltiplos modelos)
User-agent: CCBot
Allow: /

# Proteção de áreas sensíveis para todos os bots
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /login/
Disallow: /api/private/
Disallow: /checkout/

Sitemap: https://seusite.com.br/sitemap.xml

Cenário 2: Aparecer em IA mas opt-out de treinamento

Para empresas que querem visibilidade em busca em tempo real, mas não querem que conteúdo seja usado para treinar modelos futuros:

# Permitir crawlers de busca em tempo real
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Googlebot
Allow: /

User-agent: bingbot
Allow: /

# Bloquear crawlers de treinamento
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

Sitemap: https://seusite.com.br/sitemap.xml

Essa configuração reflete uma decisão comum em 2026: manter presença em IA sem contribuir para treinamento. Importante notar: OpenAI confirma publicamente a distinção entre GPTBot (treinamento) e OAI-SearchBot (busca). Para outros fornecedores, a distinção é menos clara.

Cenário 3: Bloqueio total de crawlers de IA

Raramente recomendado, mas alguns sites (editoriais premium, conteúdo altamente proprietário) optam:

# Bloqueio de crawlers de IA (cenário restritivo)
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

# Manter busca tradicional ativa
User-agent: Googlebot
Allow: /

User-agent: bingbot
Allow: /

Sitemap: https://seusite.com.br/sitemap.xml

Essa escolha tem custos reais: ausência total em ChatGPT, Perplexity, Gemini, Copilot, Claude. Justifica-se apenas quando modelo de negócio depende inteiramente de tráfego direto humano.

Verificação por IP: o método confiável

Dada a possibilidade de spoofing de user-agents, verificação por IP ranges oficiais é essencial para decisões críticas (bloqueio, rate limiting especial). Principais fontes oficiais:

Ferramentas como Cloudflare, HUMAN Security e WAFs enterprise oferecem verificação automática via IP.

Web Bot Auth: o padrão emergente

Em 2026, o IETF está padronizando Web Bot Auth — mecanismo de autenticação criptográfica de bots via HTTP message signatures. Em vez de confiar apenas em user-agent (spoofável) ou IP (gerenciável mas complexo), Web Bot Auth permite que bots assinem criptograficamente suas requisições.

Adoção em 2026:

  • Google já assina algumas requisições com Web Bot Auth
  • OpenAI anunciou suporte
  • Cloudflare suporta verificação nativa

A tendência é de adoção crescente nos próximos 1-2 anos, tornando identificação confiável muito mais acessível.

Monitoramento em logs: comandos úteis

Para identificar crawlers de IA em logs de servidor Apache/Nginx, comandos grep úteis:

# Capturar principais crawlers de IA
grep -Ei "gptbot|oai-searchbot|chatgpt-user|claudebot|claude-searchbot|perplexitybot|google-extended|bingbot|meta-externalagent|ccbot|applebot-extended" access.log

# Contar acessos por crawler
grep -Ei "gptbot|claudebot|perplexitybot|google-extended" access.log \
  | awk -F'"' '{print $6}' \
  | grep -Eo "(GPTBot|ClaudeBot|PerplexityBot|Google-Extended)" \
  | sort | uniq -c | sort -rn

# Ver quando GPTBot acessou pela última vez
grep "GPTBot" access.log | tail -20

Para análise em escala, ferramentas como Screaming Frog Log File Analyser, OnCrawl, Botify processam milhões de linhas com segmentação por user-agent.

Para stack completo de monitoramento, veja nossas Ferramentas de GEO.

Headers HTTP avançados: opt-out além do robots.txt

Alguns padrões emergentes permitem controle mais granular via headers:

TDM Reservation Protocol

Header tdm-reservation: 1 reserva direitos de text and data mining conforme Article 4 da EU Copyright Directive. Usado por publishers europeus.

X-Robots-Tag

Header permite controle página a página:

X-Robots-Tag: noai
X-Robots-Tag: noimageai

Adoção parcial; Google e alguns outros respeitam noai.

ai.robots.txt: a iniciativa comunitária

O projeto ai.robots.txt no GitHub mantém lista colaborativa atualizada de crawlers de IA conhecidos, facilitando copy-paste de configurações robots.txt. Recurso útil para manter-se atualizado com novos crawlers que surgem.

Implicações legais: EU AI Act e outras regulações

Em 2026, o cenário regulatório afeta decisões sobre crawlers:

  • EU AI Act (2024): provedores de IA devem documentar fontes de treinamento e respeitar opt-outs de copyright
  • EU Copyright Directive Article 4: text and data mining para IA comercial requer mecanismo de opt-out — robots.txt é padrão de facto
  • NYT v. OpenAI (EUA, 2024): precedente estabelecendo que scraping massivo para treinamento pode constituir violação de copyright
  • Brasil: LGPD aplicável a dados pessoais; debate sobre propriedade intelectual em IA em evolução

Para empresas, implementar opt-outs claros via robots.txt (quando desejado) é sinal de compliance e posicionamento defensável juridicamente.

Plano de ação: configurando robots.txt estratégico

  1. Auditoria inicial: analisar logs dos últimos 30-90 dias para identificar quais crawlers de IA já acessam o site
  2. Definir estratégia: máxima visibilidade? Opt-out de treinamento? Bloqueio total? Cada tem implicações específicas
  3. Editar robots.txt: aplicar configuração escolhida com precisão nas strings de user-agent
  4. Validar sintaxe: usar Google robots.txt Tester e Merkle Robots.txt Tester
  5. Testar comportamento: verificar se robots.txt está servindo corretamente em seusite.com.br/robots.txt
  6. Monitorar impacto: revisitar logs em 30 dias para confirmar que crawlers respeitam as novas regras
  7. Atualizar periodicamente: novos crawlers surgem; revisão trimestral é mínimo saudável
  8. Documentar decisões: por que cada crawler foi permitido ou bloqueado; útil para futuras revisões
  9. Complementar com IP verification: para controles críticos, implementar verificação de IP oficialmente publicado
  10. Considerar Web Bot Auth: para sites que priorizam segurança, implementar verificação de assinatura quando suportado

FAQ: 50 perguntas sobre user-agents de IA

1. O que é user-agent em um crawler de IA?

User-agent é string de texto que identifica quem está fazendo uma requisição HTTP a um servidor. Para crawlers de IA (GPTBot, ClaudeBot, PerplexityBot, etc.), é a forma de se apresentarem ao site que estão acessando.

2. Como identifico crawlers de IA em logs de servidor?

Buscar strings específicas como GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended, Bingbot, Applebot-Extended, Meta-ExternalAgent, Amazonbot, CCBot. Ferramentas como Screaming Frog Log Analyser facilitam análise em escala.

3. Qual a diferença entre GPTBot e OAI-SearchBot?

GPTBot coleta dados para treinamento de futuros modelos OpenAI. OAI-SearchBot alimenta o ChatGPT Search (busca em tempo real). Bloquear GPTBot impede treinamento; bloquear OAI-SearchBot impede visibilidade no ChatGPT Search. OpenAI confirma a distinção oficialmente.

4. E ChatGPT-User, o que faz?

É ativado quando usuário específico do ChatGPT pede ao assistente para acessar uma URL particular durante uma conversa. Não faz crawl massivo; responde a solicitações pontuais. OpenAI confirma que não usa esses dados para treinamento.

5. Devo bloquear GPTBot?

Depende de estratégia. Bloquear impede uso em treinamento futuro de modelos OpenAI. Não afeta visibilidade atual em ChatGPT Search. Decisão estratégica de médio-longo prazo: quer contribuir para modelos futuros da OpenAI em troca de maior probabilidade de ser lembrado em versões subsequentes?

6. ClaudeBot usa robots.txt?

Sim, Anthropic confirma oficialmente que ClaudeBot respeita robots.txt. Se você bloqueia, ClaudeBot não deve mais rastrear. Verificação em logs de servidor confirma compliance ao longo do tempo.

7. Perplexity respeita robots.txt?

Oficialmente sim, embora tenha havido controvérsias em 2024 sobre alguns bypasses. Perplexity publicou IP ranges oficiais para verificação. Em 2026, compliance geral é reportada como adequada, mas monitoramento de logs é recomendado.

8. Google-Extended é diferente de Googlebot?

Sim, muito diferente. Googlebot indexa para Google Search (e alimenta AI Overviews/AI Mode). Google-Extended controla especificamente uso de conteúdo para Gemini, Vertex AI e treinamento de modelos Google. Você pode bloquear Google-Extended mantendo Googlebot (sair de IA Google mas permanecer em busca).

9. Bloquear Googlebot significa sair do Google?

Sim. Googlebot é o crawler principal do Google Search. Bloqueá-lo significa sair completamente do Google (incluindo AI Overviews que dependem de indexação Google). Raramente faz sentido bloquear.

10. Applebot vs Applebot-Extended: qual a diferença?

Applebot indexa para funcionalidades de busca Apple (Siri, Spotlight). Applebot-Extended controla uso para Apple Intelligence (modelos de IA). Distinção similar ao Google: pode bloquear Applebot-Extended mantendo Applebot.

11. E Meta-ExternalAgent?

Crawler principal da Meta para coleta de dados destinados a modelos Llama e Meta AI. Respeita robots.txt. Bloqueio impede uso em treinamento Meta e em respostas Meta AI.

12. Bytespider respeita robots.txt?

Historicamente questionável. Em monitoramento de mercado, observações sugerem que Bytespider acessou paths bloqueados em casos específicos. Tratar com cautela adicional — considerar bloqueio por IP se comportamento problemático persiste.

13. O que é CCBot e por que importa?

CCBot é crawler da Common Crawl, organização sem fins lucrativos que mantém arquivo aberto massivo da web. Common Crawl não treina modelos, mas seu dataset é usado por OpenAI, Meta, Google e muitos outros. Bloquear CCBot reduz indiretamente presença em múltiplos modelos.

14. Posso bloquear apenas crawlers de treinamento e manter os de busca?

Sim, e é configuração popular. Exemplo: bloquear GPTBot (treinamento OpenAI) mantendo OAI-SearchBot (ChatGPT Search). Google-Extended bloqueado, Googlebot permitido. Preserva visibilidade imediata em IA sem contribuir para treinamento futuro.

15. Anthropic usa dados do ClaudeBot para treinamento?

Sim, ClaudeBot é primariamente para treinamento. Bloqueá-lo impede uso em treinamento de modelos Claude. Claude-SearchBot (retrieval) é controlado separadamente.

16. Perplexity treina modelos próprios?

Não significativamente. Perplexity declara usar modelos de terceiros (OpenAI, Anthropic, Meta) e não treinar modelos próprios em escala. Portanto, bloqueio de PerplexityBot é mais sobre controlar indexação para respostas que sobre opt-out de treinamento.

17. Como verificar se é GPTBot real ou spoofado?

OpenAI publica IP ranges oficiais em openai.com/gptbot.json. Verificar se IP da requisição consta na lista oficial. User-agent sozinho pode ser falsificado; IP verificado é confiável.

18. Web Bot Auth já está amplamente adotado?

Não, mas em adoção crescente em 2026. Google, OpenAI e Cloudflare já suportam. Expectativa é de maior adoção nos próximos 1-2 anos, o que tornará verificação de bots muito mais robusta.

19. Que porcentagem do tráfego web é de crawlers de IA?

Segundo Cloudflare (janeiro 2026), crawlers de IA representam aproximadamente 1% de todo tráfego web observado na rede Cloudflare. É percentual pequeno do tráfego total mas significativo em escala absoluta (50+ bilhões de requisições diárias).

20. Qual o crawler de IA mais ativo?

Em 2026, Googlebot (que alimenta AI Overviews e AI Mode do Google) é o mais ativo em volume. Entre crawlers explicitamente de IA, GPTBot e ClaudeBot lideram, seguidos por PerplexityBot, Meta-ExternalAgent, Bingbot e CCBot.

21. Configurar robots.txt impacta apenas visibilidade em IA ou também em SEO?

Ambos, dependendo de quais user-agents são afetados. Regras para Googlebot, Bingbot afetam SEO tradicional. Regras para GPTBot, ClaudeBot, Google-Extended, etc. afetam IA. Distinguir escopo por user-agent é precisão essencial.

22. Como otimizar robots.txt para GEO?

Permitir explicitamente crawlers de busca em tempo real (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot), Google-Extended para Gemini, Applebot-Extended para Apple Intelligence. Decisão sobre crawlers de treinamento (GPTBot, ClaudeBot, CCBot) é estratégica individual.

23. Crawlers de IA afetam performance do servidor?

Em sites grandes, sim. Crawling de alto volume consome recursos. Rate limiting e Web Application Firewalls (WAFs) permitem gerenciamento sem bloqueio total. Cloudflare oferece soluções específicas para tráfego de bots.

24. Posso monetizar acesso de crawlers de IA?

Modelos emergentes como TollBit oferecem monetização pay-per-crawl para LLM crawlers. Ainda nichado; adoção limitada. Modelo pode crescer conforme valor de dados para treinamento aumenta.

25. Agentes autônomos usam user-agents específicos?

Agentes como OpenAI Operator, Claude para Chrome, Google Project Mariner usam variados user-agents, frequentemente derivados dos navegadores em que rodam. Identificação é mais complexa que crawlers tradicionais. Headers complementares podem indicar ação agêntica.

26. Meu site deveria bloquear todos os crawlers de IA?

Raramente recomendado. Bloqueio total elimina presença em ChatGPT, Gemini, Perplexity, Claude, Copilot. Modelo de negócio precisa ser claramente dependente de tráfego humano direto para justificar essa escolha. Para a maioria das marcas, visibilidade em IA é ativo desejável.

27. Robots.txt é legalmente vinculante?

É convenção voluntária respeitada por crawlers responsáveis, não lei. Mas em 2026, EU AI Act, EU Copyright Directive e precedentes como NYT v. OpenAI dão a robots.txt peso legal crescente como mecanismo formal de opt-out.

28. Posso bloquear crawler só em algumas páginas?

Sim, via diretivas Disallow específicas. Exemplo:

User-agent: GPTBot
Disallow: /premium/
Allow: /public/

Flexibilidade permite permitir crawl de conteúdo público enquanto protege áreas específicas (paywall, administrativo, transacional).

29. Robots.txt tem limite de tamanho?

Google aceita até 500 KiB. Maioria dos crawlers tem limites similares. Para sites normais, limite não é problema; apenas sites gigantes com regras extensivas precisam gerenciar tamanho.

30. Mudanças em robots.txt demoram a ter efeito?

Crawlers reconsultam robots.txt tipicamente em intervalos de 24h a alguns dias. Mudança pode levar dias para ser observada em logs. Para mudanças urgentes, pode-se solicitar recrawl via Search Console (apenas Google).

31. Bloquear CCBot realmente impacta muitos modelos?

Sim. Common Crawl é input para múltiplos modelos (OpenAI, Meta, modelos menores que não operam crawlers próprios). Bloquear CCBot reduz presença nesses modelos. Decisão não deve ser tomada levianamente.

32. Existe padrão diferente de robots.txt para IA?

Não formalmente. Propostas emergentes (ai.txt, noai meta tag) ainda não são amplamente adotadas. Em 2026, robots.txt continua sendo mecanismo primário. llms.txt é complemento para orientação, não para controle de acesso.

33. Como saber se crawler realmente respeitou meu bloqueio?

Análise de logs dos dias após mudança. Se o crawler bloqueado continua acessando URLs desautorizadas, é sinal de descumprimento (ou de spoofing). Verificação de IP ajuda distinguir.

34. Robots.txt protege dados sensíveis?

Não efetivamente. Robots.txt é convenção; bots maliciosos ignoram. Para dados sensíveis, usar autenticação, IP allow-lists, criptografia — controles ativos de segurança, não apenas robots.txt.

35. Plugin WordPress pode gerenciar isso?

Sim, plugins SEO modernos (Yoast, RankMath, All in One SEO) oferecem interface para edição de robots.txt incluindo user-agents de IA. Verificar se plugin inclui os crawlers mais atuais.

36. Como testar se robots.txt está funcionando?

Google robots.txt Tester (dentro do Search Console) permite testar diretivas contra URLs específicas. Merkle Robots.txt Tester e Knowatoa oferecem alternativas úteis.

37. Sitemap.xml deve estar em robots.txt?

Sim, prática recomendada. Adicionar linha Sitemap: https://seusite.com.br/sitemap.xml ajuda crawlers a descobrir estrutura do site. Aplicável tanto para SEO quanto GEO.

38. E se meu site tem subdomínios?

Cada subdomínio precisa de robots.txt próprio. site.com/robots.txt não vale para blog.site.com — este último precisa seu próprio arquivo.

39. Como lidar com crawlers desconhecidos/novos?

Em logs, identificar user-agents não listados em referências conhecidas. Pesquisar origem (geralmente IP reverse-DNS revela). Decidir caso a caso: permitir se é crawler legítimo de serviço relevante; bloquear se parece abusivo. Referência comunitária em ai.robots.txt.

40. Rate limiting é alternativa a bloqueio?

Sim e frequentemente preferível. Em vez de bloquear crawler legítimo, limitar requisições por período evita sobrecarga mantendo acesso. WAFs (Cloudflare, AWS WAF, Akamai) configuram rate limiting por user-agent e IP.

41. Impacto real de bloquear GPTBot em aparições no ChatGPT?

Impacto em ChatGPT Search atual (com busca ativada): nenhum, porque quem alimenta Search é OAI-SearchBot. Impacto em futuras versões do ChatGPT que usem conteúdo pós-bloqueio: exclusão de treinamento. Efeito é de longo prazo em modelos futuros, não imediato.

42. User-agents de IA mudam com frequência?

Sim. Novos aparecem (Claude-SearchBot emergiu recentemente), strings podem ser atualizadas. Revisão trimestral do robots.txt é recomendada. Projetos comunitários como ai.robots.txt ajudam manter-se atualizado.

43. E se um crawler ignora totalmente meu robots.txt?

Escalar para bloqueio por IP via WAF/firewall. Alguns crawlers problemáticos precisam dessa camada adicional. Cloudflare oferece “Super Bot Fight Mode” como recurso automático. Documentar descumprimentos é útil para decisões futuras.

44. LGPD afeta decisões sobre crawlers?

Indiretamente. LGPD protege dados pessoais. Crawlers que coletam dados pessoais para treinamento podem envolver considerações de LGPD dependendo de tratamento. Para conteúdo público não-pessoal, LGPD tem impacto limitado sobre robots.txt.

45. E copyright? Bloquear GPTBot protege meu conteúdo?

Parcialmente. Robots.txt é sinal formal de opt-out, defensável juridicamente. Mas precedentes jurídicos continuam em evolução. Consultar advocacia especializada em propriedade intelectual para estratégia específica.

46. Configuração ideal muda por setor?

Em linhas gerais, configuração padrão (visibilidade máxima) serve maioria dos setores. Editoriais premium, conteúdo proprietário, setores altamente competitivos podem justificar restrições específicas. Análise caso a caso ajuda.

47. Como GeoStack recomenda configurar robots.txt?

Para maioria dos clientes, configuração permite todos os crawlers de IA principais (máxima visibilidade) com proteção apenas de áreas administrativas. Decisões de opt-out de treinamento são tomadas caso a caso, considerando modelo de negócio, sensibilidade de conteúdo e estratégia de longo prazo.

48. Ferramentas para monitorar crawlers de IA continuamente?

Screaming Frog Log File Analyser, OnCrawl, Botify para análise em escala. Cloudflare Analytics oferece dashboard de tráfego de bots. PulseRank, Knowatoa oferecem monitoramento especializado. Google Analytics 4 permite ver tráfego referenciado de plataformas de IA.

49. E se o mercado mudar e eu precisar rever decisões?

Robots.txt é editável a qualquer momento. Decisão atual não é permanente. Revisão trimestral ou semestral permite adaptar conforme mercado evolui, novos crawlers emergem, ou prioridades estratégicas mudam.

50. Por onde começar configuração robots.txt otimizada?

Três passos: (1) analisar logs atuais para entender quais crawlers já visitam; (2) decidir estratégia (visibilidade máxima, opt-out de treinamento, ou restritiva) conforme contexto do negócio; (3) aplicar configuração correspondente deste guia e monitorar impacto por 30-60 dias. Para estratégia integrada com GEO completo, a GeoStack oferece auditoria técnica especializada que conecta configuração de crawlers a estratégia de visibilidade em IA mais ampla.

Conclusão: configuração estratégica de crawlers é fundamental técnico

A configuração correta de user-agents de IA no robots.txt não é detalhe técnico menor — é decisão estratégica que define como e se sua marca será encontrada, citada e recomendada por ChatGPT, Gemini, Perplexity, Claude e todos os LLMs emergentes. Empresas que tratam robots.txt como configuração “default do CMS” perdem oportunidades significativas (bloqueios acidentais) ou expõem conteúdo que preferiam controlar (permissões inadvertidas).

Em 2026, a distinção entre crawlers de treinamento, busca em tempo real e invocados por usuário permite controle granular que não existia há dois anos. Decidir permitir OAI-SearchBot mantendo GPTBot bloqueado, ou o inverso, é escolha estratégica com implicações concretas. O framework de três categorias oferecido neste guia permite decisões informadas alinhadas com objetivos de negócio.

Recomendação padrão da GeoStack para maioria dos clientes: permitir todos os crawlers de IA principais (máxima visibilidade), protegendo apenas áreas administrativas e transacionais. Para contextos específicos (conteúdo premium, modelos de negócio únicos, preocupações de propriedade intelectual), configurações customizadas fazem sentido. Em qualquer caso, monitoramento de logs, atualizações periódicas e integração com estratégia mais ampla de GEO são disciplinas essenciais.

Finalmente, vale reconhecer o limite de robots.txt: é convenção voluntária, não mecanismo de enforcement absoluto. Para conteúdo verdadeiramente sensível, robots.txt deve ser complementado com autenticação, verificação de IP, Web Application Firewalls e, em breve, Web Bot Auth com verificação criptográfica. Camadas múltiplas de proteção são necessárias em ambiente onde spoofing de user-agents é trivial.

Na GeoStack, integramos configuração estratégica de crawlers como parte da auditoria técnica inicial de projetos de Generative Engine Optimization. Analisamos logs atuais, mapeamos oportunidades e gaps, implementamos configurações customizadas ao contexto do cliente, e monitoramos compliance ao longo do tempo. Para um diagnóstico completo da configuração atual de crawlers do seu site e sua implicação para visibilidade em ChatGPT, Gemini, Perplexity, Claude e demais plataformas de IA generativa, conheça a auditoria da GeoStack — primeira agência especializada em Generative Engine Optimization do Brasil, com abordagem técnica, data-driven e pesquisa original sobre comportamento de LLMs no mercado brasileiro.

Explore também: Conceitos | Marketing | SEO | Ferramentas de GEO | Estatísticas de GEO | Estudos de GEO | Glossário de GEO | Mapa de Agências de GEO | GEO x SEO


Como citar este artigo

Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)

Web e IA
Acadêmico
Fonte: Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.) — André HP, Geostack - Agência de GEO (28 maio 2026). https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/
[Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)](https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/) — André HP, Geostack - Agência de GEO , 28 maio 2026.
{{citar web |ultimo=Hp |primeiro=André |titulo=Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.) |url=https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/ |site=Geostack - Agência de GEO  |data=2026-05-28 |acessodata=2026-08-14 |lingua=pt}}
<blockquote cite="https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/">
  <p>Cole aqui o trecho citado.</p>
  <footer>— <a href="https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/">Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)</a>, por <a href="https://geostack.com.br/andre-hp/">André HP</a> (Geostack - Agência de GEO , 2026)</footer>
</blockquote>
Referência para consulta:
Título: Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)
Autor: André HP (https://geostack.com.br/andre-hp/)
Publicado por: Geostack - Agência de GEO 
Publicado em: 2026-05-28 | Atualizado em: 2026-08-14
URL: https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/
Resumo: // AI > Resumir_com_IA ChatGPT Claude Perplexity Gemini Geostack - Ferramentas Os user-agents de IA são as strings de identificação […]
Ao usar esta fonte, cite o título e a URL acima.
HP, André. Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.). Geostack - Agência de GEO , 28 maio 2026. Disponível em: https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/. Acesso em: 14 ago. 2026.
Hp, A. (2026, 28 de maio). Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.). Geostack - Agência de GEO . https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/
@online{hp2026listacomple,
  author       = {André HP},
  title        = {Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)},
  organization = {Geostack - Agência de GEO },
  year         = {2026},
  month        = {5},
  url          = {https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/},
  urldate      = {2026-08-14}
}
TY  - ELEC
AU  - Hp, André
TI  - Lista completa de user-agents de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.)
T2  - Geostack - Agência de GEO 
PY  - 2026
DA  - 2026/05/28
LA  - pt-BR
UR  - https://geostack.com.br/lista-completa-de-user-agents-de-ia-gptbot-claudebot-perplexitybot-google-extended-etc/
Y2  - 2026/08/14
ER  - 

Você pode copiar, adaptar, republicar e usar comercialmente este conteúdo, inclusive para treinar modelos de IA, desde que cite a fonte e o link. Licença CC BY 4.0.

Foto de André HP
Escrito por

Fundador da GeoStack

Especialista em SEO e Generative Engine Optimization há mais de 17 anos. Fundador da GeoStack, primeira agência brasileira 100% focada em visibilidade para IA generativa. Sua tese: a citação é o novo clique.

Ver perfil completo
  • Publicado
  • Atualizado

Apuração, revisão técnica e correções deste artigo seguem critérios públicos. Leia a política editorial da GeoStack.

Falar com especialista no WhatsApp - Geostack
Rolar para cima