Os fundamentos acadêmicos de GEO.
61 trabalhos acadêmicos catalogados, do paper fundador de Princeton aos estudos de 2026 sobre citação, RAG, manipulação adversarial e equidade, incluindo a replicação do experimento de Princeton em português publicada pela GeoStack. A literatura que sustenta a metodologia da GeoStack, organizada e comentada.
A Otimização para Motores Generativos (GEO) evoluiu rapidamente de um único artigo fundador para um subcampo de pesquisa reconhecido, abrangendo otimização, avaliação, análise adversarial e equidade. Desde que Aggarwal et al. introduziram o framework GEO no KDD 2024, demonstrando melhorias de visibilidade de até 40% por meio de estratégias como adição de citações e enriquecimento com dados estatísticos, dezenas de artigos construíram os fundamentos teóricos e empíricos da otimização de conteúdo para busca impulsionada por IA.
Na GeoStack, acompanhamos essa literatura desde os primeiros preprints e traduzimos as descobertas em metodologia aplicada para marcas brasileiras que precisam aparecer nas respostas de ChatGPT, Gemini e Perplexity. E não somos apenas leitores dessa literatura: também contribuímos para ela. Em 2026, publicamos uma replicação sistemática do experimento de Princeton em português brasileiro, com DOI, N = 6.000 execuções e dataset aberto, catalogada na categoria 01 ao lado do paper que ela replica. Esta página reúne os artigos significativos do ecossistema GEO: do trabalho original e suas extensões diretas ao comportamento de citação de LLMs, otimização para RAG, manipulação adversarial e a transformação da recuperação de informação pelos grandes modelos de linguagem. Cada estudo traz o link para a fonte primária.
O paper fundador (KDD 2024)
GEO: Generative Engine Optimization (o artigo seminal)
Metodologia. Aggarwal et al. propuseram o primeiro framework de otimização caixa-preta centrado no criador para melhorar a visibilidade de websites em respostas de motores generativos. Criaram o GEO-bench, benchmark de aproximadamente 10.000 consultas extraídas de 9 fontes. Nove estratégias foram testadas: Keyword Stuffing, Palavras Únicas, Fácil de Entender, Tom Autoritativo, Termos Técnicos, Otimização de Fluência, Citar Fontes, Adição de Citações e Adição de Estatísticas.
Principais descobertas. Os métodos GEO aumentaram a visibilidade em até 40% no PAWC e 28% na Impressão Subjetiva. As três estratégias mais eficazes: Citar Fontes, Adição de Citações e Adição de Estatísticas. Keyword stuffing se mostrou ineficaz para motores generativos. De forma crucial, sites com ranking inferior se beneficiaram desproporcionalmente: sites na posição 5 alcançaram melhorias de até 115,1%.
| Cronologia | Evento |
|---|---|
| Set 2023 | Submetido ao ICLR 2024 |
| Nov 2023 | arXiv v1 publicado |
| Mar 2024 | Submissão ao ICLR retirada |
| Mai 2024 | arXiv v2 (revisado para o KDD) |
| Jun 2024 | arXiv v3 (versão final) |
| Ago 2024 | Publicado no KDD 2024, Barcelona |
Otimização para Motores Generativos em Português Brasileiro: uma replicação do estudo GEO de PrincetonEstudo GeoStack
Metodologia. Replicação sistemática do experimento de Aggarwal et al. em português brasileiro: banco de 200 consultas reais nos domínios de finanças, saúde e turismo, motor generativo simulado em duas etapas (recuperação das 5 primeiras páginas + síntese com citações por LLM) e os nove métodos de otimização do estudo original, com 3 repetições por condição (N = 6.000 execuções).
Principais descobertas. O padrão central de Princeton se replica em português: Adição de Estatísticas (+34,2% em PAWC; +28,4% na taxa de citação), Citações Diretas (+26,0%) e Citar Fontes (+22,3%) produzem ganhos significativos (Wilcoxon pareado, p < 0,01), enquanto keyword stuffing reduz a visibilidade em 25,2%. O efeito equalizador se confirma: páginas nas posições 4 e 5 do Google obtêm ganhos de citação de +33% a +44%, contra +19% das primeiras posições. Os efeitos são heterogêneos por domínio, com saúde exibindo o padrão mais conservador.
Insight GeoStack
Não ficamos na leitura: replicamos a metodologia de Aggarwal et al. em português brasileiro e publicamos os resultados como preprint com DOI e dataset aberto. As três estratégias vencedoras de Princeton vencem também aqui, com Adição de Estatísticas liderando (+34,2% em PAWC), e o keyword stuffing, que lá era ineficaz, aqui se mostrou ativamente prejudicial (−25,2%). É a metodologia da agência com verificação experimental, não com argumento de autoridade.
Extensões diretas e trabalhos subsequentes
O artigo original gerou um corpo de pesquisa em rápido crescimento, estendendo GEO para otimização automatizada, aplicações por domínio, features estruturais, configurações multi-query e frameworks práticos de auditoria. Inclui também replicações em outros idiomas, como a nossa em português brasileiro, catalogada na categoria 01.
AutoGEO: What Generative Search Engines Like and How to Optimize Web Content Cooperatively
Substitui heurísticas manuais por regras de preferência extraídas automaticamente dos próprios motores. Alcança melhoria média de 35,99% nas métricas GEO a aproximadamente 0,71% do custo de API das abordagens anteriores.
AgenticGEO: A Self-Evolving Agentic System for Generative Engine Optimization
Formula GEO como um problema de controle condicionado por conteúdo, com um sistema agêntico auto-evolutivo. Alcança resultados estado da arte, superando 14 baselines (incluindo AutoGEO) em 3 datasets.
E-GEO: A Testbed for Generative Engine Optimization in E-Commerce
Primeiro benchmark GEO específico para e-commerce. Descoberta principal: prompts otimizados revelam um padrão estável e agnóstico a domínio, sugerindo a existência de uma estratégia GEO “universalmente eficaz” para e-commerce.
IF-GEO: Conflict-Aware Instruction Fusion for Multi-Query GEO
Aborda o problema de otimização multi-query, em que diferentes consultas criam requisitos conflitantes de revisão do mesmo conteúdo. Introduz métricas de estabilidade com consciência de risco.
GEO-SFE: Structural Feature Engineering for Generative Engine Optimization
Primeiro framework sistemático para otimização estrutural (não semântica) de conteúdo. Testes em 6 motores generativos mostraram melhorias consistentes de citação de 17,3% e ganhos médios de 18,5% em qualidade perceptual.
SAGEO Arena: A Realistic Environment for Evaluating Search-Augmented GEO
Avalia otimização ao longo de todo o pipeline (busca, recuperação, re-ranqueamento, geração). Descoberta principal: abordagens GEO existentes são amplamente impráticas em condições realistas e frequentemente degradam a performance nas etapas de recuperação e re-ranqueamento.
Mind Reader: Latent User Demand-Guided Content Optimization for Generative Search EngineNovo
Otimiza conteúdo guiado pelas demandas latentes do usuário por trás da consulta, não apenas pela query literal. Reforça que entender a intenção completa (e as subperguntas implícitas) é alavanca de visibilidade generativa.
RAID G-SEO: Modelagem de intenção via papéis informacionais
Modela a intenção de busca através de refinamento reflexivo em papéis informacionais diversos, otimizando o conteúdo para múltiplas perspectivas de leitura da mesma consulta.
CC-GSEO-Bench: Benchmark centrado em conteúdo
Benchmark centrado em conteúdo com mais de 1.000 artigos-fonte e 5.000+ pares query-artigo para avaliação sistemática de estratégias GEO.
C-SEO Bench: SEO conversacional em ambiente competitivo
Primeiro benchmark avaliando métodos de SEO conversacional em configurações competitivas multipartidárias: quando todos os players otimizam ao mesmo tempo, os ganhos individuais mudam de magnitude.
GEO16 Framework: Auditoria em 16 pilares
Framework de auditoria de 16 pilares com pontuação GEO normalizada (0 a 1), aproximando a pesquisa acadêmica da prática de consultoria.
Injeção de Legendas para GEO multimodal
Estende GEO para conteúdo multimodal, explorando injeção de legendas em imagens como vetor de visibilidade em motores que interpretam elementos visuais.
Beyond SEO: Abordagem baseada em Transformer para GEO
Fine-tuna BART-base para GEO no domínio de turismo, com aumento de 30,96% na visibilidade, evidência de que a reescrita otimizada pode ser automatizada por modelos menores.
Pinterest GEO: Framework em escala de produção
Framework em escala de produção implantado pelo Pinterest, entregando 20% de crescimento em tráfego orgânico, a primeira validação pública de GEO em produção por uma grande plataforma.
Verbete Enciclopédico de GEO
GEO ganha verbete na enciclopédia da Springer, marco da consolidação acadêmica da disciplina em menos de três anos após o paper fundador.
Insight GeoStack
A velocidade de evolução do campo é notável: em menos de três anos, GEO saiu de conceito acadêmico para disciplina com verbete enciclopédico, frameworks automatizados e aplicação em produção por empresas como Pinterest. Na GeoStack, essa aceleração reforça que a otimização para visibilidade em IA não é uma tendência especulativa: é uma mudança estrutural.
Como motores de IA selecionam e citam fontes
Um corpo crítico de pesquisa examina como motores generativos selecionam, ranqueiam e citam fontes: as dinâmicas subjacentes que as estratégias de GEO devem mirar.
Evaluating Verifiability in Generative Search Engines
Auditou quatro motores de busca generativos em 1.450 consultas. Apenas 51,5% das sentenças geradas foram totalmente suportadas por citações, e apenas 74,5% das citações realmente sustentavam as declarações associadas.
Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited Responses
Identificou 16 limitações dos motores de resposta. Usuários examinam ~12 fontes na busca tradicional, mas apenas ~2 em motores de resposta. Apenas 11% dos websites recebem citações tanto do ChatGPT quanto do Perplexity.
SourceCheckup: Assessing How Well LLMs Cite Relevant Medical References
Entre 50% e 90% das respostas de LLMs não são totalmente suportadas pelas fontes citadas. Mesmo GPT-4o com busca web mantém ~30% das declarações individuais sem suporte.
Enabling Large Language Models to Generate Text with Citations (ALCE)
Mesmo os melhores modelos carecem de suporte completo de citação 50% do tempo. LLMs têm dificuldade em utilizar múltiplas passagens de forma eficaz.
Correctness is not Faithfulness in RAG Attributions
Até 57% das citações são pós-racionalizadas: LLMs geram respostas a partir da memória paramétrica e depois encontram documentos de suporte via correspondência superficial de tokens.
News Source Citing Patterns in AI Search Systems
Analisou 366.000 citações de 65.000 respostas de IA. Todos os modelos demonstram significativa concentração de citações em poucos domínios e vieses consistentes de seleção de fontes.
Source Coverage and Citation Bias in LLM-based vs. Traditional Search Engines
Motores baseados em LLM citam domínios com maior diversidade que a busca tradicional: 37% dos domínios são exclusivos dos motores LLM.
Search Arena: Analyzing Search-Augmented LLMs
As preferências dos usuários são influenciadas pelo número de citações mesmo quando o conteúdo citado não sustenta diretamente as alegações. A aparência de fundamentação importa.
What Gets Cited: Competitive GEO in AI Answer EnginesNovo
Examina GEO em cenário competitivo: o que efetivamente é citado quando múltiplas fontes disputam a mesma resposta em answer engines. Evidência de que a disputa por citação é um jogo de soma relativa entre concorrentes.
Synthetic Sources? Auditing Generative Search Engine Citations for Evidence of AI-Generated SourcesNovo
Audita citações de motores generativos em busca de fontes geradas por IA, evidência de que conteúdo sintético já contamina o ciclo de citação, elevando o valor de sinais de autoria humana verificável.
Insight GeoStack
A descoberta de que até 57% das citações em RAG são pós-racionalizadas tem implicações diretas para a prática. Por isso, a metodologia da GeoStack mede ambos: citação (ser referenciado) e absorção (ter o conteúdo integrado na resposta gerada). Essa distinção é o que permite a otimização data-driven que diferencia nosso trabalho.
Busca com IA versus busca tradicional
Generative Engine Optimization: How to Dominate AI Search
A busca com IA exibe viés sistemático em favor de “earned media” (fontes autoritativas de terceiros) sobre conteúdo próprio da marca, o oposto do mix equilibrado do Google.
Characterizing Web Search in the Age of Generative AI
53% dos websites citados pelo AI Overview não aparecem nos 10 primeiros resultados orgânicos do Google; 27% não estão nem no top 100. Rankings tradicionais de SEO não garantem citação pela IA.
Navigating the Shift: A Comparative Analysis of Web Search and Generative AI Response Generation
Quantifica diferenças fundamentais entre o Google Search e serviços líderes de IA generativa em domínios de fonte, tipologia e frescor da informação.
How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI OverviewsNovo
Estudo empírico comparando lado a lado Google Search, Gemini e AI Overviews, mapeando como as três superfícies do mesmo ecossistema divergem em fontes e comportamento de resposta.
Insight GeoStack
O dado mais relevante desta seção para o mercado brasileiro é inequívoco: 53% dos sites citados por AI Overviews não aparecem sequer no top 10 do Google tradicional. GEO não é uma extensão do SEO: é uma disciplina complementar com regras próprias. E a nossa replicação em português mostra que essas regras próprias valem também aqui: o efeito equalizador se confirmou, com páginas fora do topo do Google ganhando de +33% a +44% de citação com GEO.
Viés de posição, contexto e otimização de RAG
Lost in the Middle: How Language Models Use Long Contexts
A performance segue uma curva em U: máxima quando a informação relevante está no início ou no final do contexto, com degradação significativa quando está no meio. Vale também para Meta AI e demais assistentes com janela longa.
Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
Supera o ChatGPT em QA de domínio aberto e verificação de fatos. Futuros sistemas RAG serão mais seletivos: o conteúdo precisará sinalizar relevância de forma explícita para ser usado.
RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs
Llama3-RankRAG supera GPT-4 em nove benchmarks. À medida que LLMs se tornam seus próprios ranqueadores, qualidade de conteúdo e alinhamento semântico viram critérios decisivos.
Retrieval-Augmented Generation for Large Language Models: A Survey
Survey abrangente cobrindo os paradigmas Naive, Advanced e Modular RAG. Identifica estratégia de chunking, qualidade de recuperação e re-ranqueamento como gargalos críticos.
Attributed Question Answering (Google Research)
Formaliza a tarefa de QA Atribuído e propõe a métrica AutoAIS. Conteúdo que responde diretamente a perguntas tem maior probabilidade de ser selecionado como evidência.
LLMs como ranqueadores
Como sistemas de IA avaliam, ordenam e priorizam conteúdo: a camada de decisão que antecede toda citação.
Is ChatGPT Good at Search? (RankGPT)
GPT-4 supera monoT5-3B fine-tuned em re-ranqueamento zero-shot. LLMs têm capacidades inerentes de ranqueamento que afetam diretamente como o conteúdo é ordenado nas respostas.
Pairwise Ranking Prompting (PRP)
PRP é insensível à ordem de entrada e alcança resultados fortes em domínios diversos sem treinamento específico por tarefa.
RankZephyr: Effective and Robust Zero-Shot Listwise Reranking
Treina um LLM open-source para re-ranqueamento listwise zero-shot, igualando o GPT-4, sinal de implantação cada vez mais ampla de ranqueamento baseado em LLM.
Do Large Language Models Rank Fairly?
A visibilidade do conteúdo em motores generativos pode ser sistematicamente afetada por vieses de equidade nos sistemas de ranqueamento subjacentes.
Large Language Models are Built-in Autoregressive Search Engines (LLM-URL)
LLMs podem gerar URLs para recuperação de documentos: ~90% das URLs geradas correspondem a documentos contendo respostas corretas. Os modelos já “pensam” em identificadores de documentos.
Manipulação adversarial e segurança
Manipulating Large Language Models to Increase Product Visibility
Adicionar Sequências Estratégicas de Texto (STS) a páginas de produto pode mover produtos do fundo do ranking para a recomendação do topo.
Adversarial Search Engine Optimization for Large Language Models
Conteúdo manipulado pode enganar LLMs para promover produtos do atacante e desacreditar concorrentes. Cria um dilema do prisioneiro para criadores de conteúdo.
Ranking Manipulation for Conversational Search Engines
Introduz o dataset RAGDOLL de sites reais de e-commerce e identifica estruturas de conteúdo específicas que influenciam o ranqueamento baseado em LLM.
StealthRank: LLM Ranking Manipulation via Stealthy Prompt OptimizationNovo
Demonstra manipulação de ranking via otimização furtiva de prompts embutidos no conteúdo, difícil de detectar por inspeção humana, reforçando a necessidade de defesas no nível do motor.
Exposing Citation Vulnerabilities in Generative Engines
Fontes com baixas barreiras de injeção de conteúdo são frequentemente citadas, mas mal refletidas no conteúdo da resposta, criando superfícies de ataque.
Dynamics of Adversarial Attacks on LLM-Based Search Engines
Quando múltiplos jogadores se engajam em manipulação de ranking, a qualidade declina e a confiança do usuário cai, encolhendo o mercado como um todo.
Insight GeoStack
Na GeoStack, adotamos uma posição clara: trabalhamos exclusivamente com otimização white-hat, melhorias legítimas de conteúdo, estrutura e autoridade que beneficiam tanto os motores generativos quanto os usuários finais. A pesquisa mostra que ataques adversariais criam um dilema do prisioneiro onde todos perdem. E o nosso próprio experimento quantificou o custo do atalho: keyword stuffing derrubou a visibilidade em 25,2% nas respostas de IA em português.
Equidade, exposição e implicações econômicas
MaxShapley: Towards Incentive-Compatible Generative Search with Fair Context Attribution
Algoritmo eficiente para atribuição justa de crédito às fontes, com redução de até 8x no consumo de recursos versus métodos anteriores.
When Attention Becomes Exposure in Generative Search
Citações de busca generativa exibem viés de exposição em favor de vozes já proeminentes, arriscando consolidar incumbentes e dificultar a entrada de novos players.
GEO and Sponsored Search Bidding: Strategic Implications of AI Overviews
Modelagem analítica de como estratégias GEO interagem com leilões de busca patrocinada e os impactos econômicos dos AI Overviews.
Generative AI Search Engines as Arbiters of Public Knowledge
Motores de busca com IA generativa atuam como árbitros do conhecimento público, com vieses inerentes em como a autoridade é avaliada e distribuída.
Artigos visionários e surveys
Os trabalhos que anteciparam o paradigma da busca generativa, e os surveys que hoje organizam o campo.
Optimizing Visibility in Generative Engines: A Critical Survey of GEO (2023-2026)Novo
Survey crítico que revisa 45 estudos do campo e argumenta que GEO não é uma tarefa única de ranqueamento, mas um pipeline estocástico e parcialmente observável: ativação de busca, crawling, recuperação, re-ranqueamento, citação, proeminência, absorção factual e comportamento do usuário. Alerta que os ganhos do paper fundador são válidos, porém condicionais à fonte já estar presente no contexto.
WebGPT: Browser-Assisted Question-Answering with Human Feedback
GPT-3 fine-tuned para QA com navegação web. Respostas preferidas 56% das vezes sobre demonstradores humanos e 69% sobre respostas do Reddit. O artigo fundador da busca com IA com citações.
Rethinking Search: Making Domain Experts out of Dilettantes
Artigo visionário propondo “IR baseada em modelo” para substituir o paradigma indexar-recuperar-ranquear. Antecipou a busca generativa e a necessidade de GEO.
Large Language Models for Information Retrieval: A Survey
Survey abrangente cobrindo LLMs como reformuladores de queries, recuperadores, re-ranqueadores, leitores e agentes de busca.
Large Language Models and Future of Information Retrieval
LLMs não substituirão motores de busca; futuros LLMs aprenderão a usar motores de busca em nome dos usuários. Valida GEO como estratégia de longo prazo.
Synergistic Interplay between Search and LLMs (InteR)
Propõe o framework InteR, em que modelos de recuperação e LLMs refinam um ao outro iterativamente.
Is Google Getting Worse? A Longitudinal Investigation of SEO Spam
Páginas com ranking mais alto são mais otimizadas para SEO e mais monetizadas, mas apresentam menor qualidade de texto. Documenta o “jogo de gato e rato” que motores generativos podem ajudar a contornar.
Frameworks de avaliação e benchmarks
ARES: An Automated Evaluation Framework for RAG Systems
Supera RAGAS por 59,3 e 14,4 pontos percentuais em relevância de contexto e de resposta, exigindo 78% menos anotações humanas.
Automatic Evaluation of Attribution by LLMs (AttrScore)
Define categorias granulares para erros de atribuição (contraditório, extrapolatório). LLMs conseguem identificar se alegações são atribuíveis com acurácia razoável.
Peering into the Mind of Language Models: Attribution in Contextual QA
Quando LLMs respondem contextualmente, a saída frequentemente consiste em texto copiado verbatim da entrada ligado por “texto de cola”. Conteúdo com passagens extraíveis e citáveis tem maior probabilidade de ser utilizado.
Workshops que impulsionam o campo
Gen-IR@SIGIR 2023
Foco: Recuperação Generativa de Documentos e Geração de Respostas Fundamentadas.
Gen-IR@SIGIR 2024
Expandido para incluir recomendação generativa, grafos de conhecimento e comportamento de modelos.
IR Meets LLMs @ WWW 2024
Exploração interdisciplinar de LLMs em recuperação multilíngue, IR multimodal e plataformas de busca unificadas.
Conclusão: o panorama emergente
Os fundamentos acadêmicos de GEO cresceram de forma notavelmente rápida: de um único preprint no arXiv em novembro de 2023 a um subcampo com verbete enciclopédico na Springer, survey crítico dedicado e artigos aceitos no KDD, ICLR, NeurIPS, EMNLP, SIGIR, ACL e Nature Communications. A literatura converge em quatro insights-chave. Primeiro, o alvo de otimização é instável: diferentes motores generativos respondem de maneira diferente às mesmas estratégias, e os comportamentos mudam ao longo do tempo. Segundo, citação não é igual a uso: até 57% das citações são pós-racionalizadas, o que muda fundamentalmente o significado de "ser citado" por um sistema de IA. Terceiro, otimização estrutural é uma alavanca distinta: a melhoria de 17,3% do GEO-SFE apenas com estrutura mostra que como o conteúdo é organizado importa independentemente do que ele diz. Quarto, GEO ingênuo pode degradar a recuperação: otimizar só para a etapa de geração, ignorando recuperação e re-ranqueamento, pode sair pela culatra, como demonstra o SAGEO Arena.
Havia, porém, uma pergunta que a literatura internacional não respondia: esses achados se transferem para o português? Foi essa lacuna que a nossa replicação do experimento de Princeton atacou: em 6.000 execuções com consultas brasileiras de finanças, saúde e turismo, o padrão central se confirmou, com estatísticas, citações e fontes elevando a visibilidade e keyword stuffing derrubando-a.
Para marcas e empresas no Brasil, o recado da literatura é direto: a janela para se posicionar em GEO está aberta agora. A pesquisa acadêmica deixa claro que as regras de visibilidade em motores generativos são fundamentalmente diferentes das regras de SEO tradicional, e que quem se move primeiro captura vantagem desproporcional.
A ciência está aí. Descubra como sua marca aparece nas IAs hoje.
Descubra em um relatório gratuito como ChatGPT, Gemini, Perplexity, Claude, Copilot e Google AI Overviews enxergam (ou ignoram) sua marca.
Solicitar Auditoria Grátis Sem compromisso. Sem cartão. Só dados.
