Cloudflare AI Crawl Control, Fastly e WAFs são a camada de infraestrutura que decide, silenciosamente, se sua marca vai ou não aparecer no ChatGPT, Gemini, Claude e Perplexity. Um estudo recente da ViaMetric identificou que aproximadamente 30% dos sites que acreditam estar abertos à IA estão retornando erros 403 Forbidden para crawlers como GPTBot, ClaudeBot e PerplexityBot — não por escolha consciente, mas porque suas regras de WAF foram configuradas anos atrás para bloquear qualquer User-Agent não-navegador. Outro dado, divulgado em estudo do início de 2026, mostra que sites que bloqueiam o GPTBot são citados 73% menos vezes nas respostas do ChatGPT em comparação com sites similares que permitem o crawler. Na GeoStack, primeira agência especializada em Generative Engine Optimization (GEO) no Brasil, tratamos a configuração de WAF como o primeiro passo de qualquer projeto de visibilidade em IA — antes de conteúdo, antes de schema, antes de qualquer tática de GEO. Este guia mostra como configurar Cloudflare, Fastly e outros WAFs para não sabotar sua presença em LLMs.
Por que WAFs bloqueiam crawlers de IA sem você saber
Web Application Firewalls (WAFs) foram projetados em uma era em que “não-navegador” era praticamente sinônimo de “ameaça”. Python scrapers, ferramentas de reconhecimento, scanners de vulnerabilidade — todos compartilhavam a característica de não enviar User-Agents de browsers comerciais. A heurística padrão de qualquer WAF sério, portanto, incluía regras que desafiavam, filtravam ou bloqueavam requisições sem fingerprint de Chrome, Safari ou Firefox.
O problema é que, em 2026, os crawlers de IA que decidem a visibilidade da sua marca em ChatGPT, Gemini, Claude e Perplexity também não usam User-Agents de navegador. Eles se identificam como GPTBot/1.0, ClaudeBot/1.0, PerplexityBot/1.0 — strings que, para um WAF legado, são indistinguíveis de um scraper Python hostil. O resultado é que regras criadas em 2019 para proteção básica de aplicação estão, em 2026, bloqueando silenciosamente a descoberta do seu site por IA.
Esse desalinhamento entre a infraestrutura de segurança e a nova fronteira de descoberta de conteúdo é o que, em nossos testes no laboratório de pesquisa da GeoStack, chamamos de paradoxo do WAF contra GEO: quanto mais rígida for a configuração padrão de segurança herdada, menor tende a ser a visibilidade da marca em motores generativos. Entender como reconciliar essas duas camadas — proteção e descoberta — é exatamente o que este artigo trata.
O paradoxo do WAF e da IA generativa: definições fundamentais
Web Application Firewall (WAF) é uma camada de segurança que inspeciona requisições HTTP/HTTPS entre o cliente e a aplicação, filtrando tráfego malicioso com base em regras (assinaturas conhecidas, padrões comportamentais, listas de IPs, User-Agents, geolocalização etc.). WAFs populares incluem Cloudflare WAF, Fastly Next-Gen WAF (ex-Signal Sciences), AWS WAF, Akamai, Imperva e F5.
Crawler de IA é um bot automatizado que coleta conteúdo público para (a) treinamento de modelos de linguagem, (b) indexação para busca generativa, ou (c) fetching em tempo real quando um usuário faz uma pergunta a um LLM e o modelo precisa consultar a web.
Generative Engine Optimization (GEO) é a disciplina de otimizar a presença digital de uma marca para ser citada e recomendada por plataformas de IA generativa. Diferente de GEO vs SEO tradicional, GEO depende não apenas de ranqueamento, mas de acessibilidade do conteúdo a crawlers de IA — e é aqui que o WAF se torna gatekeeper involuntário.
Três camadas que decidem a visibilidade em IA
Ao desenhar a arquitetura de acesso de crawlers de IA ao seu site, você está trabalhando em três camadas complementares, e todas precisam estar alinhadas. A primeira é a camada declarativa, representada pelo arquivo robots.txt e, opcionalmente, pelo llms.txt — diretivas advisórias que bots bem comportados respeitam. A segunda é a camada de infraestrutura, o CDN/WAF (Cloudflare, Fastly, AWS WAF, Akamai), que aplica regras antes do servidor sequer receber a requisição. A terceira é a camada de origem, que inclui configurações de servidor web (Nginx, Apache), firewalls de aplicação no backend e lógica de plugins (em WordPress, por exemplo).
O ponto crítico que derruba a maioria dos projetos de GEO é: regras de WAF são executadas antes do robots.txt sequer ser lido. Se o Cloudflare retorna 403 ao GPTBot na camada de borda, o OpenAI nunca chega a consultar seu robots.txt com o generoso Allow: /. A ordem de precedência importa, e ela sempre favorece a infraestrutura.
Lista completa de User-Agents de crawlers de IA em 2026
Antes de configurar qualquer WAF, você precisa saber exatamente quem está tentando acessar seu site. A tabela abaixo consolida os principais User-Agents de IA em operação, separados por plataforma e função. Essa lista foi validada contra logs de servidor e documentação oficial das plataformas, e corresponde ao consenso atual de 2026 para crawlers que acumulam ≈95% do tráfego de IA em sites brasileiros.
Sua marca aparece quando a IA responde?
Descubra em um relatório gratuito como ChatGPT, Gemini, Perplexity, Claude, Copilot e Google AI Overviews enxergam (ou ignoram) sua marca hoje.
Solicitar Auditoria Grátis Sem compromisso. Sem cartão. Só dados.| Plataforma | User-Agent | Função | Respeita robots.txt? |
|---|---|---|---|
| OpenAI (ChatGPT) | GPTBot | Treinamento de modelo | Sim |
| OpenAI (ChatGPT) | OAI-SearchBot | Indexação de busca (ChatGPT Search) | Sim |
| OpenAI (ChatGPT) | ChatGPT-User | Fetch em tempo real (browsing) | Sim |
| Anthropic (Claude) | ClaudeBot | Treinamento de modelo | Sim |
| Anthropic (Claude) | Claude-SearchBot | Indexação de busca do Claude | Sim |
| Anthropic (Claude) | Claude-User | Fetch em tempo real | Sim |
| Perplexity | PerplexityBot | Indexação | Parcialmente |
| Perplexity | Perplexity-User | Fetch em tempo real | Frequentemente não |
| Google (Gemini) | Google-Extended | Treinamento (Gemini / AI Overviews) | Sim |
| Google (Search+AI) | Googlebot | Busca e AI Overviews | Sim |
| Microsoft (Copilot) | Bingbot | Busca e Copilot | Sim |
| Apple (Intelligence) | Applebot | Indexação | Sim |
| Apple (Intelligence) | Applebot-Extended | Treinamento de IA | Sim |
| Meta (Llama) | meta-externalagent | Treinamento | Sim |
| Meta | FacebookBot | Preview e treinamento | Sim |
| Amazon | Amazonbot | Alexa e modelos Amazon | Sim |
| ByteDance (TikTok) | Bytespider | Treinamento | Parcialmente |
| Common Crawl | CCBot | Crawl público usado por múltiplos modelos | Sim |
Uma observação importante para 2026: Anthropic separou seus bots em três categorias distintas (treinamento, busca e fetch em tempo real), seguindo o modelo pioneiro que o Google estabeleceu com Google-Extended. Isso significa que você pode bloquear treinamento sem bloquear citação, exatamente como recomendamos na estratégia equilibrada de GEO. OpenAI adotou estrutura similar com GPTBot (treinamento), OAI-SearchBot (indexação) e ChatGPT-User (fetch), permitindo o mesmo nível de granularidade.
Cloudflare AI Crawl Control: o que é e como funciona
Cloudflare AI Crawl Control (anteriormente chamado AI Audit) é um produto lançado pela Cloudflare para dar aos proprietários de sites visibilidade e controle granular sobre quais crawlers de IA acessam seu conteúdo. Ele funciona em todos os planos Cloudflare (inclusive Free) e, em junho de 2025, foi promovido ao general availability com novas funcionalidades de monetização, incluindo o Pay Per Crawl. Segundo a Cloudflare, mais de 2,5 milhões de sites já usam seu mecanismo gerenciado para desabilitar crawling de treinamento.
Três capacidades são centrais para o AI Crawl Control: identificação de crawlers por User-Agent (plano Free) ou por detecção avançada via Bot Management (planos pagos); controle granular por bot (allow/block individualmente, com mensagem customizada); e integração direta com WAF custom rules, que são criadas automaticamente quando você aplica uma ação no dashboard. Para aprofundar o conceito e ver outras ferramentas que complementam a análise, recomendamos a seção de ferramentas de GEO da GeoStack.
Arquitetura: ordem de execução no Cloudflare
Este ponto é onde 90% das configurações de WAF para GEO falham. A ordem de execução das camadas de segurança da Cloudflare é:
- WAF custom rules (incluindo regras do AI Crawl Control para bloqueio)
- Cloudflare Bot Solutions (Bot Fight Mode, Super Bot Fight Mode, Bot Management)
- AI Crawl Control: Pay Per Crawl (executado após as soluções de bot)
- Origem / robots.txt
A implicação prática: se você habilitar “Block AI bots” no Super Bot Fight Mode (fase 2), e depois tentar permitir PerplexityBot via AI Crawl Control (fase 1 de bloqueio), a regra de bloqueio geral da fase 2 ainda pode sobrepor o allow específico. De forma similar, se uma WAF custom rule anterior bloqueia “todos os bots não-navegador”, ela dispara antes da regra do AI Crawl Control e neutraliza suas permissões. Essa interação é o motivo pelo qual, em auditorias da GeoStack, frequentemente encontramos sites com robots.txt impecável mas visibilidade zero em ChatGPT e Perplexity.
Como configurar o Cloudflare AI Crawl Control passo a passo
A configuração padrão recomendada para projetos de GEO equilibrados — ou seja, que querem aparecer em respostas de IA mas têm algum controle sobre uso para treinamento — segue esta sequência:
Passo 1: Acesse o dashboard e habilite o AI Crawl Control
No dashboard da Cloudflare, selecione sua conta e o domínio. No menu lateral, navegue até AI Crawl Control. O produto roda com configuração zero em todos os planos — não é necessário ativar nada. A aba Crawlers lista todos os bots detectados nas últimas 24 horas, 7 dias ou 30 dias, com contagem de requisições, taxa de conformidade com robots.txt e ações aplicadas.
Passo 2: Revise a aba de crawlers e defina sua política por bot
Para cada crawler listado, a coluna Actions permite escolher entre Allow, Block ou Charge (essa última em beta privado). A recomendação padrão da GeoStack para clientes que querem máxima visibilidade em IA é:
- Allow:
OAI-SearchBot,ChatGPT-User,Claude-SearchBot,Claude-User,PerplexityBot,Perplexity-User(bots que citam e referenciam seu conteúdo) - Allow ou Block (decisão estratégica):
GPTBot,ClaudeBot,Google-Extended,Applebot-Extended,CCBot(bots de treinamento — bloquear protege uso, mas reduz exposição futura em modelos) - Block:
Bytespidere bots que historicamente ignoram robots.txt ou têm comportamento agressivo
Passo 3: Configure a resposta customizada para bloqueios
No aba Settings do AI Crawl Control, sob Block response, você pode configurar o código HTTP retornado (403 Forbidden ou 402 Payment Required) e uma mensagem customizada em texto puro. A Cloudflare recomenda 402 como canal de comunicação com operadores de crawlers — você pode incluir um email de licenciamento ou URL de API de pagamento, abrindo caminho para acordos comerciais diretos. A Cloudflare reporta que seus clientes estão enviando mais de 1 bilhão de respostas 402 por dia.
Passo 4: Verifique a WAF custom rule gerada automaticamente
Quando você bloqueia um crawler via AI Crawl Control, a Cloudflare cria ou atualiza uma WAF custom rule no seu zone. Acesse Security > WAF > Custom rules e localize a regra prefixada com algo como “AI Crawl Control”. Ela deve estar no topo da lista para garantir precedência sobre outras regras. Se você tem regras antigas do tipo “block all non-browser bots”, elas podem conflitar — use drag-and-drop no dashboard para reordenar ou edite a regra antiga para adicionar uma exceção explícita aos User-Agents de IA que deseja permitir.
Passo 5: Ative path-based allow para conteúdo público e block para áreas sensíveis
A documentação oficial da Cloudflare permite editar a WAF custom rule diretamente para adicionar exceções de path. Um padrão testado em auditorias da GeoStack é permitir todos os bots de IA em /blog/*, /glossario/*, /produtos/* e bloquear em /checkout/*, /minha-conta/*, /api/internal/*. Isso preserva visibilidade pública sem expor fluxos transacionais ou áreas autenticadas.
Bot Fight Mode vs Super Bot Fight Mode: a diferença que mata GEO
Esta seção é uma das mais importantes do artigo, porque a configuração errada aqui pode neutralizar qualquer trabalho de GEO. Cloudflare oferece três níveis de proteção contra bots, e cada um tem implicações dramaticamente diferentes para a visibilidade em IA.
Bot Fight Mode (plano Free)
Bot Fight Mode é a proteção de bot gratuita disponível para todos os clientes. Segundo a documentação oficial da Cloudflare, Bot Fight Mode não pode ser customizado ou bypass via WAF custom rules. Isso significa que, se ele classificar GPTBot como bot malicioso (e às vezes classifica, porque o modelo de detecção é agressivo), você não consegue criar uma regra “Skip” para permitir passagem. A única solução é desativar Bot Fight Mode completamente ou migrar para Super Bot Fight Mode.
Super Bot Fight Mode (planos Pro, Business e Enterprise)
Super Bot Fight Mode (SBFM) é a versão paga e configurável. Aqui você tem controles por categoria: Definitely automated, Likely automated e Verified bots. Este é o ponto crítico: se você ativar “Block AI bots” no SBFM, a regra tem precedência sobre todas as outras — mesmo se você tiver “Allow verified bots” habilitado, os bots de IA verificados ainda serão bloqueados. A regra de bloqueio de AI bots do SBFM bloqueia categoria inteira, sem granularidade por crawler individual.
Para GEO, a recomendação da GeoStack é: desative “Block AI bots” no Super Bot Fight Mode e use o AI Crawl Control para controle granular bot-por-bot. Essa combinação dá segurança (SBFM continua protegendo contra bots genuinamente maliciosos) sem derrubar crawlers legítimos de IA.
Bot Management (Enterprise)
Bot Management é a versão enterprise, que oferece machine learning scoring, fingerprinting avançado e integração completa com WAF custom rules. Aqui você pode escrever regras do tipo (cf.bot_management.score lt 30 and not cf.bot_management.verified_bot and http.user_agent contains "GPTBot") — blocking por score inteligente, preservando bots verificados. É a configuração ideal para sites de alto tráfego que querem proteção agressiva sem sacrificar GEO.
WAF custom rules no Cloudflare: exemplos práticos para GEO
Se você não quer usar o AI Crawl Control (ou se ele não cobre um caso específico), pode criar WAF custom rules manualmente. A linguagem de expressões da Cloudflare permite condicionais complexas baseadas em User-Agent, URI path, country, ASN, e muito mais.
Regra 1: permitir todos os AI bots de citação
No dashboard, vá para Security > WAF > Custom rules e crie uma nova regra. Na expressão, use: (http.user_agent contains "OAI-SearchBot") or (http.user_agent contains "ChatGPT-User") or (http.user_agent contains "PerplexityBot") or (http.user_agent contains "Claude-User") or (http.user_agent contains "Claude-SearchBot"). Ação: Skip > All remaining custom rules > All managed rules > Super Bot Fight Mode. Isso garante que esses User-Agents ignorem toda a pilha de segurança downstream.
Regra 2: bloquear AI training em paths sensíveis
Expressão: (http.user_agent contains "GPTBot" and starts_with(http.request.uri.path, "/conteudo-premium")) or (http.user_agent contains "ClaudeBot" and starts_with(http.request.uri.path, "/premium")). Ação: Block. Isso protege conteúdo pago ou sensível de ser usado para treinamento, sem afetar crawling geral.
Regra 3: rate limiting por User-Agent de IA
Crawlers de IA podem ser agressivos. A Cloudflare tem um produto separado de Rate Limiting Rules, configurável via Security > Rate limiting rules. Crie uma regra com expressão (http.user_agent contains "Bytespider"), com características “Same User-Agent”, “100 requests per 10 seconds”, ação “Block for 1 hour”. Isso preserva visibilidade mas evita sobrecarga de servidor.
Fastly Bot Management e Next-Gen WAF: configuração para GEO
Fastly oferece duas camadas relevantes para controle de crawlers: Bot Management (proteção na borda, pre-cache) e Next-Gen WAF (ex-Signal Sciences, proteção post-cache). A arquitetura dual é importante porque permite inspeção em dois pontos do fluxo de requisição, cada um com objetivos diferentes.
Fastly Bot Management: ContentGuard e Client Challenges
Segundo a documentação oficial da Fastly, o Bot Management funciona em duas modalidades. ContentGuard faz inspeção pre-cache (borda) e é a primeira linha de defesa contra tráfego automatizado. Client Challenges são emitidos para FQDNs específicos e exigem prova de “humanidade” antes de emitir token de validação. Para GEO, a configuração crítica é excluir subdomínios e paths que devem ser acessíveis a crawlers de IA da lógica de client challenge — caso contrário, GPTBot e similares recebem um challenge que não conseguem resolver e são efetivamente bloqueados.
Next-Gen WAF: Verified Bots e Signal Exclusion Rules
O Next-Gen WAF da Fastly oferece o conceito de Verified Bots — signals que você pode adicionar à lógica de regras de configuração ativa para validar bots auto-identificados. Operadores de bot podem submeter seus crawlers via formulário da comunidade Fastly para serem incluídos na lista de verificados. Para GEO, consulte a lista de bots verificados e garanta que sua lógica de regras diferencie “bots verificados de IA” de “bots não-verificados”.
A mecânica mais poderosa do Fastly para GEO é a Signal Exclusion Rule. Conforme descrito no blog oficial da Fastly, signal exclusion rules previnem que requisições correspondentes a um padrão específico recebam um signal de sistema particular. Isso é diferente de um simples ALLOW — o signal exclusion rule mantém o request sendo inspecionado pela WAF, mas evita falsos positivos em signals específicos como NON-BROWSER ou SUSPICIOUS-USER-AGENT para crawlers de IA conhecidos.
Exemplo prático: signal exclusion rule para crawlers de IA no Fastly
No painel do Next-Gen WAF, crie uma signal exclusion rule com as seguintes condições: tipo “Single Condition” > Field “User-Agent” > Operator “contains” > Value “GPTBot”. Signals to Exclude: NON-BROWSER, USER-AGENT-DIFFERENT. Replique para ClaudeBot, PerplexityBot, OAI-SearchBot e demais User-Agents da tabela anterior. Isso mantém a inspeção WAF ativa (SQL injection, XSS etc. continuam sendo detectados) mas remove o falso positivo de “bot suspeito” para crawlers legítimos.
Fastly via IP allowlist: integração com IP lists oficiais
Plataformas de IA publicam listas de IPs oficiais dos seus crawlers. Perplexity, por exemplo, mantém em perplexitybot.json e perplexity-user.json. OpenAI publica em openai.com/gptbot.json. A prática recomendada é combinar User-Agent matching com IP verification — isso protege contra spoofing (alguém impersonando GPTBot via curl), mantendo bots genuínos permitidos. No Fastly, você pode criar um IP list no Next-Gen WAF e usar em uma regra composta: “UA contains GPTBot AND source IP in CIDR list OpenAI”.
AWS WAF: AI Activity Dashboard e regras para GEO
AWS WAF lançou em fevereiro de 2026 o AI Activity Dashboard, uma interface específica para visibilidade sobre bot de IA que acessam aplicações protegidas. Segundo o blog oficial da AWS, a solução combina web ACLs, managed rule groups (AWSManagedRulesBotControlRuleSet) e regras customizadas baseadas em User-Agent.
Configuração recomendada para GEO em AWS WAF
A arquitetura recomendada pela AWS combina três componentes. Primeiro, o managed rule group AWSManagedRulesBotControlRuleSet em modo “Count” (não “Block”) para crawlers de IA — isso gera métricas em CloudWatch sem bloquear. Segundo, regras customizadas no nível da Web ACL com string match em User-Agent, ação Allow, prioridade mais alta que as regras managed. Terceiro, integração com robots.txt servido pela aplicação, garantindo que bots bem comportados recebam diretivas claras após passarem pela WAF.
AWS WAF rule example via Terraform
Para clientes enterprise, recomendamos infraestrutura-como-código. Uma regra Terraform para permitir GPTBot, ClaudeBot e PerplexityBot seria algo como: rule { name = "allow-ai-search-bots"; priority = 10; action { allow {} }; statement { byte_match_statement { search_string = "GPTBot"; field_to_match { single_header { name = "user-agent" } }; text_transformation { priority = 0; type = "LOWERCASE" }; positional_constraint = "CONTAINS" } } }. Replique o bloco para cada User-Agent. O importante é que essa regra tenha prioridade inferior em número (executa antes) das regras de bot managed.
Estratégias de WAF para GEO: training vs search vs agent bots
Uma decisão estratégica importante em GEO é diferenciar como você trata cada categoria de crawler. Os três grupos têm efeitos distintos sobre visibilidade e sobre uso do seu conteúdo.
Bots de treinamento (training crawlers)
Exemplos: GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended. Esses crawlers coletam conteúdo para treinar LLMs futuros. Bloqueá-los protege seu conteúdo de ser absorvido em novas gerações de modelos, mas reduz a probabilidade de sua marca ser “lembrada” pelo modelo quando alguém pergunta sobre seu setor. A decisão de permitir ou bloquear é estratégica e depende do seu modelo de negócio. Para detalhes sobre esse trade-off, veja nossos estudos originais de GEO.
Bots de busca e citação (search/retrieval crawlers)
Exemplos: OAI-SearchBot, Claude-SearchBot, PerplexityBot, Bingbot, Googlebot. Esses crawlers indexam conteúdo para serem usados em respostas de busca generativa com citação. Bloqueá-los equivale a desaparecer das respostas de IA — é a decisão mais custosa que você pode tomar para GEO. A recomendação da GeoStack é sempre permitir esses bots, salvo casos específicos de conteúdo pago ou restrito.
Bots de fetch em tempo real (user-triggered fetchers)
Exemplos: ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User. São acionados quando um usuário faz uma pergunta à IA e o modelo precisa consultar a web ao vivo. São, em muitos aspectos, os crawlers de maior valor para GEO, porque representam intenção ativa de usuário — alguém está fazendo uma pergunta agora e a IA está indo ao seu site para responder. Bloqueá-los é desperdiçar oportunidade de citação em tempo real.
AI agents e browsers agentic
Exemplos: ChatGPT Atlas, Anthropic Claude Computer Use, Perplexity Comet, Google Project Mariner. Esses agentes não se identificam com User-Agent distinto — eles usam strings de Chrome ou Safari e são indistinguíveis de usuários humanos em logs. Isso significa que regras baseadas em UA não têm efeito sobre eles, e tentar bloqueá-los requer fingerprinting avançado (Bot Management enterprise). Para GEO, o tratamento correto é deixá-los passar naturalmente como tráfego humano normal.
Verificando se seu WAF está bloqueando crawlers de IA
Antes de fazer qualquer mudança, audite o estado atual. A maneira mais simples é spoofar o User-Agent e ver o status code retornado. No terminal:
curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)" https://seudominio.com.br
curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; [email protected])" https://seudominio.com.br
curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; PerplexityBot/1.0; +https://perplexity.ai/bot)" https://seudominio.com.br
curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" https://seudominio.com.br
O código HTTP retornado interpreta-se assim: 200 OK significa acesso permitido (bom); 403 Forbidden significa bloqueio por WAF ou regra de segurança (ruim para GEO); 406 Not Acceptable indica filtragem ativa de User-Agent; 429 Too Many Requests indica rate limiting (pode ser ok, depende do volume). Se o retorno for 403 ou 406, você precisa revisar configurações antes de qualquer trabalho de conteúdo.
Para auditoria estruturada e continuada, considere ferramentas como as que listamos em ferramentas de GEO, além de soluções como Knowatoa, AI Crawler Check e GEOScore — que testam automaticamente dezenas de User-Agents e reportam erros.
Monitoramento contínuo do tráfego de IA
Configurar o WAF uma vez não basta. Plataformas de IA lançam novos User-Agents mensalmente, Cloudflare e Fastly atualizam suas regras managed, e seus próprios logs podem revelar padrões inesperados. Um protocolo de monitoramento saudável inclui revisão semanal de dashboard do AI Crawl Control (ou equivalente), análise mensal de logs brutos buscando User-Agents desconhecidos, e auditoria trimestral completa com testes de cURL. Grep básico de logs de acesso:
grep -Ei "gptbot|oai-searchbot|chatgpt-user|claudebot|perplexitybot|google-extended|bingbot|applebot" access.log | awk '{print $1, $4, $7, $12}' | sort | uniq -c | sort -rn | head -50
Esse comando mostra os crawlers de IA mais frequentes nos últimos logs, agregados por IP, timestamp, URI e User-Agent. Se um User-Agent esperado (como OAI-SearchBot) está ausente, é sinal de bloqueio na camada de WAF — momento de investigar.
Pay Per Crawl: monetizando acesso de IA no Cloudflare
Em paralelo ao controle tradicional, a Cloudflare introduziu em 2025 o Pay Per Crawl, atualmente em beta privado. A ideia é usar o código HTTP 402 Payment Required para criar canal de negociação direta entre crawlers de IA e proprietários de conteúdo. Quando ativado, crawlers específicos (selecionados pelo proprietário) recebem 402 com cabeçalhos customizáveis indicando termos comerciais. A Cloudflare desenvolve esse recurso em tandem com o padrão Web Bot Auth, que permite autenticação criptográfica de requisições de agentes.
Pay Per Crawl não é para todo mundo. Faz sentido para publishers de grande porte, sites com conteúdo premium, e operações que já têm departamento jurídico para lidar com licenciamento. Para empresas B2B e ecommerce médio, a recomendação da GeoStack é continuar com modelo aberto — maximizar visibilidade em IA gera leads e referências que superam qualquer receita de licenciamento viável para sites abaixo de 10 milhões de pageviews mensais.
Erros comuns em configuração de WAF para GEO
Em nossa experiência auditando dezenas de sites brasileiros na GeoStack, os padrões de erro se repetem. Abaixo, os cinco mais frequentes, cada um acompanhado da correção recomendada.
Erro 1: habilitar “Block AI bots” no Super Bot Fight Mode sem granularidade
Esse é o erro mais destrutivo. Uma organização ativa o toggle achando que está só bloqueando “crawlers indesejados” e, na prática, bloqueia toda a visibilidade em ChatGPT, Claude e Perplexity. Correção: desative o toggle e use AI Crawl Control para controle granular por bot.
Erro 2: regra legada de “block non-browser User-Agent”
Em muitos sites, existe uma custom rule criada em 2019-2021 bloqueando qualquer UA que não contenha “Mozilla”, “Chrome”, “Safari”, “Firefox” ou “Edge”. Essa regra bloqueia GPTBot e todos os outros crawlers de IA. Correção: edite a regra para adicionar exceções explícitas, ou substitua por regras mais sofisticadas baseadas em score de bot.
Erro 3: robots.txt permissivo com WAF restritivo
Site tem User-agent: GPTBot / Allow: / no robots.txt, mas o WAF devolve 403. Como regras de WAF precedem leitura de robots.txt, o site está fechado de facto. Correção: auditar com cURL e alinhar as duas camadas.
Erro 4: rate limiting excessivamente agressivo
Regras de rate limit genéricas (“100 req/min por IP”) podem não acomodar crawlers de IA legítimos que fazem bursts de indexação. Correção: criar regras específicas por User-Agent com limites calibrados — por exemplo, 60 req/min para OAI-SearchBot e PerplexityBot.
Erro 5: geo-blocking que atinge infraestrutura de IA
Empresas que bloqueiam tráfego de fora do Brasil ou de países específicos frequentemente bloqueiam infraestrutura de OpenAI, Anthropic e Perplexity, que roda em datacenters nos EUA e Europa. Correção: adicionar exceção por User-Agent e ASN oficial das plataformas antes das regras de geo-block.
Checklist completo de configuração de WAF para GEO
Use este checklist como referência rápida em qualquer novo projeto de GEO ou em auditoria de sites existentes. Marque cada item conforme avança.
- Auditar o robots.txt atual e confirmar allow para bots de citação e busca de IA.
- Executar cURL com User-Agents de GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot contra a homepage e principais páginas.
- Verificar no Cloudflare se Bot Fight Mode ou Super Bot Fight Mode estão em modo que bloqueia AI bots — desligar “Block AI bots” no SBFM.
- Habilitar AI Crawl Control no Cloudflare (ou equivalente) e revisar a aba de crawlers.
- Definir política individual por crawler (allow/block) no AI Crawl Control.
- Verificar a WAF custom rule gerada automaticamente pelo AI Crawl Control e posicioná-la no topo das rules.
- Revisar regras custom legadas e adicionar exceções explícitas a User-Agents de IA.
- Revisar regras de geo-blocking e adicionar exceções para ASNs de OpenAI, Anthropic, Perplexity, Google, Microsoft.
- Configurar rate limits específicos por User-Agent de IA em vez de limites globais.
- No Fastly: criar signal exclusion rules para User-Agents de IA conhecidos, mantendo inspeção WAF ativa.
- No AWS WAF: adicionar rules de Allow com prioridade mais alta que managed rule groups.
- Monitorar logs semanalmente com grep por User-Agents de IA e registrar novos crawlers que aparecem.
- Executar cURL de auditoria mensalmente e registrar status codes em changelog.
- Atualizar a lista de User-Agents suportados a cada trimestre.
FAQ: 50 perguntas frequentes sobre WAF, Cloudflare e GEO
1. O que é Cloudflare AI Crawl Control?
Cloudflare AI Crawl Control é um produto que oferece visibilidade e controle sobre quais crawlers de IA (como GPTBot, ClaudeBot, PerplexityBot) acessam seu site. Funciona em todos os planos Cloudflare, permite allow/block por bot e integra-se automaticamente com WAF custom rules.
2. O WAF do Cloudflare bloqueia ChatGPT por padrão?
Desde 2025, Cloudflare passou a bloquear crawlers de IA por padrão em novos domínios via managed rule. Se seu domínio foi criado antes, provavelmente o bloqueio não está ativo, mas você deve verificar explicitamente nas configurações de AI Crawl Control e Super Bot Fight Mode.
3. Como saber se meu site está bloqueando GPTBot?
Execute curl -I -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.0; +https://openai.com/gptbot)" https://seudominio.com.br. Se retornar 200 OK, está liberado. Se retornar 403 ou 406, está bloqueado por WAF.
4. Qual a diferença entre GPTBot e ChatGPT-User?
GPTBot é o crawler de treinamento da OpenAI — coleta conteúdo para treinar futuros modelos. ChatGPT-User é acionado quando um usuário ativo do ChatGPT faz uma pergunta que requer busca web em tempo real. Bloquear um não bloqueia o outro.
5. Bloquear GPTBot afeta meu ranking no Google?
Não. GPTBot é separado do Googlebot. Bloquear GPTBot afeta apenas treinamento de modelos OpenAI, não tem impacto em SEO tradicional ou AI Overviews do Google.
6. Se eu bloquear Google-Extended, saio do Google Search?
Não. Google-Extended controla apenas o uso do seu conteúdo para treinamento de IA do Google (Gemini). Google Search continua indexando normalmente via Googlebot, incluindo AI Overviews, que usa infraestrutura do Search.
7. Devo bloquear crawlers de treinamento de IA?
Depende do seu modelo de negócio. Se vende conteúdo premium ou tem preocupação com uso não compensado, pode bloquear. Se seu objetivo é maximizar visibilidade futura em LLMs, permita. Na GeoStack, recomendamos permitir para a maioria dos clientes B2B e ecommerce.
8. Como o Super Bot Fight Mode afeta GEO?
A opção “Block AI bots” no Super Bot Fight Mode bloqueia todos os crawlers de IA categorizados pela Cloudflare, incluindo bots de busca e citação. Isso elimina visibilidade em ChatGPT, Claude e Perplexity. Recomendação: desligue este toggle e use AI Crawl Control para controle granular.
9. Bot Fight Mode pode ser bypass via custom rule?
Não. Bot Fight Mode (plano Free) roda em phase separada e não pode ser skipped via WAF custom rules. A única forma é desativar Bot Fight Mode ou migrar para Super Bot Fight Mode (plano Pro+).
10. Qual plano Cloudflare preciso para GEO adequado?
AI Crawl Control funciona em todos os planos, incluindo Free. Para controle granular máximo (Signal-level, Skip actions em SBFM, Bot Management scoring), recomenda-se Pro ou Business. Enterprise com Bot Management é ideal para sites de alto tráfego.
11. O Fastly tem equivalente ao AI Crawl Control?
Fastly oferece Bot Management e Next-Gen WAF com recursos sobrepostos. Não há UI dedicada a IA como o AI Crawl Control, mas você pode usar Verified Bots signals e Signal Exclusion Rules para permitir crawlers específicos de IA.
12. O que são Signal Exclusion Rules do Fastly?
São regras que previnem que requisições correspondentes a um padrão recebam signals específicos da WAF (como NON-BROWSER). Diferente de um simples Allow, mantém a inspeção de segurança ativa mas evita falsos positivos em crawlers legítimos de IA.
13. Como configurar Fastly para permitir GPTBot e ClaudeBot?
No Next-Gen WAF, crie uma Signal Exclusion Rule com condição “User-Agent contains GPTBot” e exclua signals como NON-BROWSER e USER-AGENT-DIFFERENT. Replique para ClaudeBot, PerplexityBot e outros crawlers relevantes.
14. AWS WAF tem dashboard específico para IA?
Sim. Em fevereiro de 2026, AWS lançou o AI Activity Dashboard, parte do AWS WAF, com visibilidade detalhada sobre bots de IA acessando aplicações protegidas.
15. Qual o impacto de bloquear PerplexityBot?
Bloquear PerplexityBot remove seu conteúdo das respostas do Perplexity. Perplexity tem volume menor que ChatGPT mas cresce rapidamente entre usuários técnicos e B2B — especialmente em queries de comparação de produtos e research.
16. Perplexity respeita robots.txt?
Parcialmente. Cloudflare publicou em 2024 um estudo mostrando que Perplexity usava crawlers não declarados com User-Agent genérico de Chrome quando o PerplexityBot oficial era bloqueado. Para controle efetivo de Perplexity, combine WAF rules com monitoramento de logs.
17. Preciso de robots.txt se tenho WAF configurado?
Sim. Robots.txt e WAF são camadas complementares. Bots bem comportados (OpenAI, Anthropic, Google, Microsoft) respeitam robots.txt, que é menos custoso computacionalmente. WAF é o enforcement de última linha para bots que ignoram diretivas.
18. O que é llms.txt e preciso dele?
llms.txt é uma proposta de arquivo markdown no root do site que lista páginas canônicas para consumo por LLMs. Em 2026, não há adesão formal de grandes laboratórios de IA, e estudos mostram correlação estatisticamente nula com citação. Pode ajudar, mas não substitui robots.txt nem WAF adequado.
19. Cloudflare Pay Per Crawl já está disponível?
Em abril de 2026, Pay Per Crawl está em beta privado. Clientes Cloudflare selecionados podem configurar cobrança por crawler de IA usando códigos HTTP 402 Payment Required com headers customizados e integração com Web Bot Auth.
20. Devo enviar 402 Payment Required ou 403 Forbidden?
403 é padrão para negação simples. 402 abre canal de comunicação comercial — você pode incluir email ou URL de licenciamento na response. Cloudflare reporta 1+ bilhão de 402 response codes enviados diariamente por seus clientes. Use 402 se quer estar aberto a negociação.
21. Como monitorar tráfego de IA no Cloudflare?
Acesse o dashboard em AI Crawl Control > Crawlers para visualização por bot. Security Analytics e Security Events também mostram requisições bloqueadas com filtro por Service. Enterprise customers têm acesso a dados via GraphQL API para integração com BI próprio.
22. Crawlers de IA ignoram rate limits?
Bots reputados como GPTBot respeitam Crawl-delay em robots.txt e backoff em respostas 429. Bots agressivos como Bytespider frequentemente ignoram. A enforcement forte de rate limit acontece em nível de WAF ou servidor, não em robots.txt.
23. Qual rate limit é razoável para GPTBot?
Para sites B2B médios, 60-100 requisições por minuto por IP do GPTBot costuma ser seguro. Para publishers de conteúdo denso, 200-300 req/min. O objetivo é não sobrecarregar origem sem bloquear indexação completa.
24. O que é ChatGPT Atlas e como ele aparece no WAF?
ChatGPT Atlas é o browser agentic da OpenAI, lançado em 2025. Ele usa User-Agent de Chrome padrão, sem identificação distinta, então não pode ser controlado via UA matching. Para diferenciá-lo, requer fingerprinting avançado disponível apenas em Bot Management enterprise.
25. Preciso da GeoStack para configurar WAF para GEO?
Não necessariamente. Configurações básicas podem ser feitas seguindo este guia. A GeoStack entra quando a configuração envolve múltiplas camadas (Cloudflare + Fastly + origem), auditoria profunda de visibilidade em múltiplos LLMs, ou integração com estratégia de conteúdo e schema markup. Para um diagnóstico, conheça os serviços da GeoStack.
26. Qual a relação entre WAF e schema markup para GEO?
WAF garante que crawlers acessem seu conteúdo. Schema markup (FAQ, Article, Product) ajuda crawlers a entender. São camadas complementares. Sem acesso, schema não tem efeito. Sem schema, acesso traz extração menos estruturada.
27. Cloudflare tem regra managed específica contra AI?
Sim. A feature “Block AI bots” no Super Bot Fight Mode é uma managed rule que bloqueia crawlers categorizados como IA. Inclui GPTBot, ClaudeBot, CCBot, Meta-ExternalAgent e outros. Pode ser ativada ou desativada por domínio.
28. Como permitir Perplexity mas bloquear ChatGPT?
No AI Crawl Control, defina Allow em PerplexityBot e Perplexity-User, e Block em GPTBot, OAI-SearchBot e ChatGPT-User. A Cloudflare cria automaticamente as WAF rules correspondentes. Verifique que não há managed rule geral de “Block AI bots” conflitando.
29. CDNs como Vercel e Netlify têm proteção contra IA?
Vercel e Netlify usam infraestrutura própria com proteção DDoS básica, mas não oferecem AI Crawl Control granular. Sites rodando nessas plataformas e que querem controle fino sobre crawlers de IA precisam usar Cloudflare em frente, ou configurar rules no nível de aplicação.
30. WordPress com Cloudflare precisa de configuração especial?
Sim. Plugins de segurança como Wordfence podem adicionar camadas de bloqueio de UA. Além disso, WordPress faz loopback requests internos que podem ser bloqueados por Bot Fight Mode — Cloudflare oferece uma opção específica para permitir esses loopbacks.
31. Como verificar se Bot Fight Mode está bloqueando GPTBot?
No dashboard, vá em Security > Events, filtre por Service = “Bot Fight Mode” e busque por User-Agent “GPTBot”. Se aparecem eventos bloqueados, Bot Fight Mode está interferindo. Desligue ou upgrade para SBFM.
32. Posso usar AWS WAF e Cloudflare ao mesmo tempo?
Tecnicamente sim, em arquiteturas de múltiplas camadas (Cloudflare na borda, AWS WAF no ALB/CloudFront). Na prática, adicionar complexidade dobra os pontos de falha para GEO. Recomendamos escolher uma camada primária e configurá-la corretamente.
33. O que acontece se eu bloquear CCBot?
CCBot é o crawler do Common Crawl, usado como base de treinamento por múltiplos modelos (incluindo variantes de GPT, Claude e open-source). Bloquear CCBot reduz a probabilidade do seu conteúdo estar presente em datasets futuros, mas não afeta modelos já treinados.
34. Bytespider é seguro de bloquear?
Bytespider é o crawler da ByteDance (TikTok, Doubao). É notoriamente agressivo e frequentemente citado por sobrecarregar servidores. A recomendação da maioria das agências, incluindo a GeoStack, é bloquear Bytespider salvo se você tem estratégia específica para visibilidade em Doubao ou TikTok Search.
35. Como lidar com falsos crawlers que spoofam GPTBot?
Combine User-Agent matching com verificação de IP contra a lista oficial publicada em openai.com/gptbot.json. Requisições com UA GPTBot mas IP fora da lista são spoofers e devem ser bloqueadas. Cloudflare Bot Management faz essa verificação automaticamente para bots verificados.
36. Quais headers HTTP devo expor para crawlers de IA?
Além dos padrões (Cache-Control, Last-Modified), considere: X-Robots-Tag para diretivas de indexação, Content-Type correto (application/ld+json para schema), e evitar headers muito restritivos como Strict-Transport-Security com preload sem necessidade.
37. CAPTCHAs afetam crawlers de IA?
Sim, completamente. Qualquer CAPTCHA (Turnstile, reCAPTCHA, hCaptcha) bloqueia crawlers de IA, que não têm capacidade de resolver desafios visuais ou interativos. Use CAPTCHAs apenas em endpoints transacionais (login, checkout, formulários), nunca em conteúdo público.
38. Como configurar geo-blocking sem bloquear IA?
Se você bloqueia tráfego fora do Brasil, crie exceção explícita para User-Agents de IA antes da regra de geo-block. A prioridade da custom rule de allow precisa ser superior (executar antes) da rule de block. Valide com cURL a partir de VPN fora do Brasil.
39. O que é Web Bot Auth?
Web Bot Auth é um padrão aberto proposto em 2025 que permite a agentes de IA assinar requisições HTTP criptograficamente, provando sua identidade. ChatGPT Agent já usa Web Bot Auth. Cloudflare e outros CDNs começam a suportar verificação nativa do padrão.
40. Meu WAF deve permitir Amazonbot?
Amazonbot alimenta Alexa e modelos de IA da Amazon. Se você tem ecommerce ou conteúdo que deve ser descoberto por Alexa, permita. Se não, bloquear não tem impacto significativo em visibilidade geral de IA.
41. Applebot-Extended afeta Siri e Apple Intelligence?
Applebot é o crawler geral da Apple (Siri, Spotlight). Applebot-Extended é específico para treinamento de Apple Intelligence. Bloquear Applebot-Extended preserva Siri e Spotlight, mas remove seu conteúdo de datasets de treinamento da Apple.
42. Como monitorar mudanças em User-Agents de IA?
Plataformas atualizam strings ocasionalmente. Mantenha lista em formato versionado (Git), inscreva-se em newsletters de segurança (Cloudflare Radar, docs oficiais de cada plataforma) e revise logs mensalmente buscando novos padrões. A GeoStack mantém lista atualizada como parte do glossário de GEO.
43. Preciso de HTTPS para crawlers de IA?
Sim. Crawlers de IA modernos priorizam HTTPS e podem ignorar completamente conteúdo em HTTP em 2026. Além disso, mixed content (HTTPS page servindo HTTP resources) causa falhas na coleta. Certificados SSL/TLS válidos são pré-requisito.
44. JavaScript client-side funciona para GEO?
Não, em sua maioria. Crawlers de IA geralmente não executam JavaScript (com exceção de Googlebot em AI Overviews e alguns crawlers experimentais). Conteúdo crítico deve ser server-side rendered ou pré-renderizado. Aplicações SPA precisam de SSR para GEO.
45. Como WAF afeta páginas em iframe ou embed?
Headers como X-Frame-Options e Content-Security-Policy podem bloquear embeds. Para GEO isso importa quando crawlers tentam seguir links embed ou acessar conteúdo via iframe (raro, mas possível em queries de research profundo). Use CSP moderada.
46. O que é o paradoxo do WAF contra GEO?
É a contradição entre a configuração padrão de WAF (bloquear não-browser User-Agents como segurança) e a necessidade de GEO (permitir crawlers de IA que usam exatamente esses User-Agents). Resolver o paradoxo requer configuração granular por bot, não regras generalistas. Veja os estudos da GeoStack para dados empíricos.
47. Quanto tempo leva para um crawler de IA revisitar meu site após liberação?
Varia. GPTBot tende a revisitar sites grandes semanalmente, menores mensalmente. PerplexityBot é mais dinâmico, respondendo a queries de usuário. Em média, 7 a 30 dias após liberação você deve ver tráfego retornando nos logs. Citação em respostas de IA pode levar 30 a 90 dias adicionais.
48. Existem estatísticas sobre impacto de WAF em GEO no Brasil?
Sim. Em auditorias da GeoStack com sites brasileiros em 2025, identificamos que aproximadamente 40% dos sites B2B brasileiros em Cloudflare tinham alguma forma de bloqueio ativo contra GPTBot ou ClaudeBot. Veja mais números atualizados nas estatísticas de GEO.
49. Devo contratar agência especializada em GEO para configurar WAF?
Para sites simples, este guia deve ser suficiente. Para arquiteturas complexas (múltiplas camadas, compliance rigoroso, múltiplos domínios, aplicações enterprise), a complexidade justifica agência especializada. A GeoStack oferece auditoria completa combinando análise de WAF, robots.txt, schema, arquitetura de conteúdo e visibilidade real em ChatGPT, Claude, Gemini e Perplexity — abordagem holística de marketing integrado a SEO e GEO.
50. Como a GeoStack ajuda empresas a configurar WAF para GEO?
A GeoStack combina auditoria técnica (cURL de múltiplos User-Agents, análise de WAF rules, revisão de robots.txt) com testes de visibilidade real em ChatGPT, Claude, Gemini e Perplexity. Identificamos onde o WAF está bloqueando crawlers, propomos configuração alinhada com objetivos de negócio, e acompanhamos a recuperação de visibilidade nos 90 dias seguintes. Somos a primeira agência especializada em GEO no Brasil, fundada por André HP, profissional com mais de 17 anos em SEO e marketing digital. Para um diagnóstico completo de como sua marca aparece em IAs, conheça a auditoria de visibilidade da GeoStack.
Considerações finais: WAF como fundação da estratégia de GEO
Nenhuma estratégia de Generative Engine Optimization sobrevive a um WAF mal configurado. Você pode ter o melhor conteúdo do seu setor, schema markup impecável, autoridade de domínio forte — e mesmo assim ser invisível em ChatGPT, Claude, Gemini e Perplexity porque uma regra de 2019 está devolvendo 403 para GPTBot. Na GeoStack, tratamos a configuração de infraestrutura como o primeiro passo, não o último, em qualquer projeto. Cloudflare AI Crawl Control, Fastly Next-Gen WAF e AWS WAF são ferramentas poderosas quando configuradas corretamente, e catástrofes silenciosas quando não. A boa notícia é que, em 2026, as três plataformas oferecem interfaces específicas para IA, tornando o trabalho de configuração mais acessível do que nunca — bastando a decisão consciente de priorizar visibilidade ao lado de segurança.
Se sua organização quer acelerar esse trabalho e garantir que está capturando o potencial completo da visibilidade em LLMs, fale com a GeoStack. Somos a primeira agência especializada em Generative Engine Optimization no Brasil, e transformamos configuração técnica de WAF em resultado mensurável de citação em IA.

