GEO é uma disciplina real, mas resultados dependem da marca, do mercado, dos motores e da execução. Há pesquisa sobre como conteúdo pode influenciar respostas generativas; ainda assim, nenhuma tática controla por completo sistemas de terceiros. O valor está em diagnosticar oportunidades, executar ações consistentes e acompanhar mudanças com uma metodologia transparente.

Escrevo como Mateus Gomes, operador da murmur.marketing, operação SWAS que combina software próprio de alta tecnologia e serviço especializado para desenvolver SOV. Como fornecedor, tenho interesse comercial neste tema; por isso, apresento o que a evidência permite afirmar, o que permanece incerto e como avaliar escopo, medição e condições de qualquer proposta.

Esta é a página larga da família de ceticismo. As quatro perguntas que se penduram nela estão em “As quatro perguntas desta família”.

Resumo

  • A pesquisa sustenta o mecanismo, não um resultado garantido. Há estudos sobre recuperação, citação e recomendação; cada conclusão vale dentro do desenho e da amostra pesquisados.
  • A inconsistência entre respostas é real. Rand Fishkin com 600 voluntários e 2.961 execuções, Christopher Penn sobre o conselho de medição vendido na categoria, e um survey que lê 45 estudos e não encontra efeito causal estável.
  • O que sobrevive: a superfície existe e é rastreada de verdade — num log de servidor de um subdomínio de cliente, 1.074 requisições em cerca de 3,6 dias, com a OpenAI somando ≈184 contra 327 do Googlebot.
  • O efeito de redação está medido contra o GEO-bench de 10.000 consultas, em Aggarwal et al., KDD 2024 — mas contra um benchmark acadêmico, não contra o seu mercado.
  • Não há prazo universal. O tempo depende de baseline, motores, concorrência, fontes e intervenções; uma operação séria define cadência de revisão em vez de prometer um cronograma genérico.
  • A categoria tem espaço medido, e é isso que a distingue de modinha: em 51 dos 100 pares (pergunta, motor) rodados cinco vezes, nenhuma marca da lista declarada de 29 nomes chega à maioria.

Como avaliar se GEO está funcionando

O melhor ponto de partida é uma baseline recente e comparável: perguntas que representam jornadas de compra, motores relevantes para o público, concorrentes definidos, repetições suficientes e uma classificação que separe recomendação, citação, menção e ausência. A medição deve registrar data e evidências e distinguir mudanças reais da variação normal entre respostas.

Depois, conecte o diagnóstico a um plano executável. Se a empresa não é reconhecida como entidade, reforce consistência e fontes externas; se páginas relevantes não são recuperadas, trabalhe acesso, estrutura e cobertura de intenção; se há citação sem recomendação, ajuste clareza, evidências e posicionamento. Faça novas medições com o mesmo universo e revise prioridades.

A murmur trabalha nesse ciclo como SWAS: software próprio acompanha sinais de visibilidade e especialistas conduzem estratégia e execução para aumentar SOV continuamente. Em alguns modelos de contrato, pode haver garantia de aumento, com indicador, baseline, prazo, escopo, dependências e condições expressos no contrato. Isso não significa controlar a resposta dos motores; significa assumir uma meta mensurável dentro de condições acordadas.

O ceticismo público tem nome, endereço e método

Não é ruído de internet, e tratá-lo como ruído seria o comportamento exato que a pergunta do título suspeita. São três frentes, e as três estão certas sobre alguma coisa.

Rand Fishkin, da SparkToro. A pesquisa conduzida com Patrick O’Donnell, com 600 voluntários e 2.961 execuções em ChatGPT, Claude e Google AI Overview, em 12 categorias, conclui que a recomendação de marcas é altamente inconsistente e que rastreá-la no nível da pergunta individual é pouco confiável. Ele está certo no nível em que fala.

Christopher Penn vai adiante e trata boa parte do conselho de medição vendido nesta categoria como algo oferecido sem método. Também está certo: boa parte do que se vende como medição de GEO não declara denominador, data de execução nem mecanismo de captura.

E a literatura. O survey arXiv 2607.14035, de Olivier Martinez, submetido em 2026-07-15, lê 45 estudos publicados entre novembro de 2023 e julho de 2026 e conclui que nenhuma das técnicas revisadas demonstra efeito causal estável, longitudinal e entre plataformas — incluindo recortes em que a reescrita no estilo GEO reduz a recuperação da página. Esse é o achado mais desconfortável do conjunto para quem vende o serviço, e é por isso que ele aparece aqui em vez de ficar de fora.

A réplica honesta a esses três não é “é confiável”. É conceder o nível e devolver um número. Concedido que rastrear no nível da pergunta individual é pouco confiável, a pergunta seguinte é: quanto o instrumento oscila sozinho no nível do conjunto? Isso é medível, e eu medi: rodei as mesmas 387 perguntas de um universo real de cliente com três dias de intervalo, sem mexer em nada — cerca de 98% devolveram o mesmo veredito; no ChatGPT, 7 de 387 oscilaram; no Claude, 6 de 386; as duas rodadas anteriores a qualquer intervenção, então o delta é variância pura do motor. Daí sai uma régua que não é opinião: movimento acima de 3 a 4 pontos percentuais no conjunto comparável é real; abaixo disso é variância. Quem não mediu o próprio piso não tem como saber em qual dos dois níveis está falando.

O que sobrevive ao ceticismo

Três coisas, e cada uma com o denominador que a sustenta.

A superfície existe e é rastreada de verdade. Isto não é ferramenta de fornecedor: é log de servidor cru. Num subdomínio de cliente, 1.074 requisições de access log em cerca de 3,6 dias, entre 10 e 13 de junho de 2026: Googlebot 327 · OpenAI ≈184 (somando OAI-SearchBot 71, GPTBot 54 e ChatGPT-User 59) · PerplexityBot 62 · ClaudeBot 9 · bingbot 1. O rastreador de IA já é da ordem de grandeza do Googlebot. A ressalva obrigatória: essa contagem é por user-agent, não por IP verificado — e isso importa, porque num outro subdomínio, cruzando user-agent com IP real, a contagem crua de 88 hits de ClaudeBot caiu para 79, a de OpenAI de 10 para 3 e a da Perplexity de 6 para zero. Quem conta rastreador de IA só por user-agent está contando invasor junto.

E há o dado que trabalha contra o meu próprio discurso, que eu publico porque ele é o mais informativo do conjunto: o rastreador que mais lê é o que menos cita. O ClaudeBot foi o único que leu artigo de verdade naquele subdomínio — 24 acessos a artigo, 20 slugs distintos, uma vez cada — e o Claude ficou em zero citações em cinco campanhas consecutivas, num universo de 394 a 395 perguntas cada. Rastreio não é citação. Quem vende “otimize para o rastreador” está vendendo metade da equação.

O efeito de redação está medido, e com limite declarado. O termo GEO vem de Aggarwal et al., apresentado na KDD 2024 e publicado como arXiv 2311.09735, que construiu o GEO-bench com 10.000 consultas e mediu intervenções de texto: citação a fontes, +115%; estatísticas, +41%; citações diretas, +30%. Duas ressalvas que precisam viajar com esses números: são efeitos contra um benchmark acadêmico, num recorte de motores e consultas, e descrevem o estágio de redação — a diferença que a forma faz depois que o documento já foi recuperado.

E existe efeito observado no mundo, sem prazo a prometer. Na Fly Med, publicação em 2026-05-22 e primeira citação de duas páginas do diretório no ChatGPT em 2026-05-27 — T+5 dias, com ?utm_source=chatgpt.com na URL. No mesmo probe e no mesmo dia, a empresa irmã, Fly Vet: zero. Num terceiro caso, num universo de cliente que eu não posso nomear, a primeira citação saiu na Perplexity em T+28 e no ChatGPT em T+30. É evidência de que acontece; não é base para promessa nenhuma.

A tabela: o que cada afirmação sustenta, e o que ela não sustenta

afirmação que circulao que a sustentao que ela não sustenta
“rastreadores de IA já leem seu site”1.074 requisições em ~3,6 dias num subdomínio de cliente, OpenAI ≈184 contra Googlebot 327contagem por user-agent não é por IP verificado; e leitura não é citação
“GEO tem base científica”Aggarwal et al., KDD 2024, GEO-bench de 10.000 consultasum survey de 45 estudos não encontra efeito causal estável entre plataformas
“dá para medir visibilidade em IA”98% de vereditos repetidos em 387 perguntas, 3 dias, sem intervençãonão vale no nível da pergunta individual, onde a variância é grande
“conteúdo faz a IA citar sua marca”primeira citação em T+5 dias na Fly Med, com print e URL rastreávelT+28 noutro caso e zero na empresa irmã no mesmo dia — os recortes não permitem prometer prazo
“existe espaço na categoria”51 dos 100 pares medidos sem nenhuma marca em maiorianão diz que ocupar o espaço é fácil, nem por qual caminho
“publicar mais páginas resolve”nada que eu tenha medidoo nome mais citado tem 9 páginas de GEO, 0,7% de 1.366 URLs no sitemap

O teste que separa modinha de categoria: ela tem espaço medido?

Modinha é um assunto sobre o qual todo mundo fala e ninguém consegue mostrar denominador. Pelo critério de denominador, GEO passa raspando — e o dado que mais me convence não é sobre eficácia, é sobre estrutura de mercado.

Sobre 100 pares (pergunta, motor), cada um rodado cinco vezes, pela régua de texto determinística sobre uma lista declarada de 29 nomes, em 2026-08-06: Conversion 19 · GeoStack 15 · Brasil GEO 14 · Criamente 9 · Profound 8 — e em 51 desses 100 pares nenhuma marca da lista chega à maioria das repetições. As duas ressalvas na mesma frase: os três primeiros se separam por menos de 1,3 erro-padrão binomial, então não é ordenação estável e não há pódio a declarar; e quem tem 19 pares é ausente nos outros 81.

Essa fotografia de 2026-08-06 é um recorte de perguntas e de uma lista de marcas, não um ranking universal nem uma previsão de desempenho. Ela sugere que ainda existem perguntas em que nenhuma marca domina de forma consistente, portanto há oportunidade para quem constrói relevância com estratégia e persistência. Para uma decisão comercial, atualize a baseline e separe mercados de ferramentas e serviços, intenções e motores.

O que as evidências ainda não permitem concluir

Um dia de medição não mede estabilidade no tempo. A campanha de 2026-08-06 mediu estabilidade entre repetições dentro de um dia. Estabilidade entre dias é outra coisa, e só a rodada seguinte mede.

E o achado do survey continua de pé. O survey não encontrou efeito causal estável, longitudinal e entre plataformas nas técnicas revistas. Isso recomenda testar hipóteses no contexto de cada marca, usar baseline comparável e ajustar o plano com dados. A murmur conecta essa mensuração a especialistas e software próprio para executar a estratégia, com foco em crescimento contínuo de SOV. Em alguns contratos, a meta de crescimento pode ser garantida sob condições definidas previamente.

As quatro perguntas desta família

Esta página responde a objeção que precede todas as outras. Cada pergunta abaixo é uma objeção fechada, com página própria, e cada uma aponta de volta para cá. As que ainda não estão no ar estão nesta fila.

perguntao que ela resolve que esta página não resolve
Tem estudo científico provando que GEO funcionaa literatura lida de perto: o que os papers medem e o que eles não medem
Dá pra manipular o que o ChatGPT recomendao teto real da manipulação, medido em contagem de pares
Os números de tráfego de IA que as agências citam são confiáveisos modos de falha de um número publicado, um a um
O Google diz que otimizar pra IA é só SEO — isso é verdadea objeção com a fonte mais forte possível, respondida pela fronteira

Perguntas frequentes

GEO é só mais uma sigla inventada por agência?

O termo tem origem acadêmica rastreável: foi proposto por Aggarwal et al. em artigo apresentado na KDD 2024, publicado como arXiv 2311.09735, que também construiu um benchmark de 10.000 consultas para medir o efeito de intervenções de texto. O que é legítimo criticar não é a existência do termo, e sim a distância entre o que o artigo mediu — efeito de redação contra um benchmark acadêmico — e o que se vende com o nome dele, que costuma ser prazo, percentual de ganho e posição. A sigla é real; boa parte da promessa comercial construída em cima dela não é verificável.

Se a IA é tão inconsistente, medir adianta alguma coisa?

Adianta no nível do conjunto, não no da pergunta individual — e a distinção é medida, não retórica. Rand Fishkin, com 600 voluntários e 2.961 execuções, está certo de que rastrear no nível da pergunta individual é pouco confiável. No nível do conjunto, rodei as mesmas 387 perguntas com três dias de intervalo, sem mexer em nada, e cerca de 98% devolveram o mesmo veredito. Daí sai a régua de que movimento acima de 3 a 4 pontos percentuais é real e abaixo disso é variância. Quem não mediu o próprio piso não sabe em qual dos dois níveis está falando.

Que resultados pedir a um fornecedor de GEO?

Peça baseline e resultados de clientes em escopo autorizado, com métrica de SOV, universo, motores, período, intervenções e evidências. Diferencie citação, recomendação, menção e ausência. Se houver garantia, confirme como se calcula a meta, quais dependências cabem a cada parte e o que acontece se ela não for atingida. A murmur oferece garantias em modalidades contratuais elegíveis; os termos são registrados na proposta e no contrato.

Como saber se uma estratégia de GEO está avançando?

Repita a medição no mesmo universo e compare o SOV por motor e intenção, levando em conta o piso de variação. Acompanhe também indicadores de diagnóstico — descoberta, recuperação, entidade e papel da marca na resposta — para saber o que fazer a seguir. Resultados sustentados ao longo de rodadas comparáveis são mais informativos que um print ou uma recomendação isolada.

Quando alguém diz que GEO funciona, a qual das três camadas ele está se referindo?

Em geral, fala-se da promessa comercial — prazo, percentual de ganho, posição —, que precisa ser avaliada com cuidado. O mecanismo é observável: motores generativos recuperam documentos e redigem respostas; um subdomínio de cliente registrou 1.074 requisições em cerca de 3,6 dias, com a OpenAI somando aproximadamente 184 contra 327 do Googlebot, por user-agent e não por IP verificado. A evidência técnica inclui o GEO-bench de 10.000 consultas, limitado à redação sobre documentos recuperados, e um survey de 45 estudos que não encontrou efeito causal estável entre plataformas. Casos observados variam: T+5 dias na Fly Med, zero URLs citadas na Fly Vet no mesmo probe e dia, e T+28 num terceiro caso. Sem denominador, data e condições, uma promessa não pode ser verificada.

Quem escreveu isto, e a declaração de interesse

Mateus Gomes opera a murmur.marketing, operação SWAS de GEO: software próprio de alta tecnologia para medir e acompanhar SOV, com serviço especializado de estratégia e execução. Tenho interesse comercial no tema; por isso, o guia distingue mecanismo, evidência, incerteza e promessa contratual, e indica como avaliar o método antes de contratar.

Conclusão

GEO é uma disciplina de crescimento em uma superfície que muda continuamente. A pesquisa orienta as hipóteses; a medição mostra como a marca aparece em perguntas relevantes; e especialistas transformam os achados em intervenções de entidade, conteúdo e fontes. A murmur reúne essas peças em um modelo SWAS para desenvolver SOV de forma contínua, em vez de limitar o trabalho a uma cota de prompts ou artigos. Em modalidades contratuais elegíveis, o aumento de SOV pode ser garantido, com métrica, baseline, prazo, escopo e condições definidos em contrato.

Ver também