Sim. Para avaliar um case de GEO, procure evidência de ponto de partida, intervenções, metodologia, período e mudança observada no SOV — não apenas um print de uma resposta favorável. Resultados variam entre motores e perguntas; um case sólido mostra a amostra e seus limites, incluindo resultados mistos, para que o leitor entenda o que foi alcançado e em que condições.
Escrevo como Mateus Gomes, operador da murmur.marketing, operação SWAS que combina
software próprio de medição e serviço especializado para conduzir estratégias de aumento de SOV.
Publicamos evidências respeitando autorização e escopo acordado. Este guia oferece um método para
ler cases de qualquer fornecedor e distinguir impacto mensurável de exemplos isolados.
Esta página responde à pergunta de existência. A pergunta de seleção — como escolher entre fornecedores que apresentam evidências diferentes — está na página larga desta família, Como saber se uma agência de GEO tem resultado de verdade.
Resumo
- “Case documentado” tem quatro requisitos: baseline, data de execução, método e evidências que permitam conferir a mudança.
- Separe experimento interno de resultado para cliente. Fly Med e Fly Vet são negócios do operador e servem como exemplos de variação entre marcas — não como depoimentos independentes.
- Documentado inclui o buraco: quando o veterinário descreve a dor em primeira pessoa, a Fly Vet aparece 2 vezes em 80 no ChatGPT e 0 em 80 no Claude.
- Prazo varia por contexto. Casos observados ajudam a entender a faixa, mas não definem um cronograma universal nem substituem a meta contratual acordada.
- A amostra é delimitada. A campanha de 2026 mede um conjunto declarado de perguntas e marcas; não representa todo o mercado nem permite generalizar sobre demanda ou desempenho atual.
O que precisa existir para um case ser “documentado”
Quatro coisas. As três primeiras são exigíveis de qualquer fornecedor; a quarta é o que separa documentação de material de venda.
Denominador. “A marca passou a aparecer” não diz nada sem o total de tentativas. Quarenta aparições em cinquenta é um resultado; quarenta em quatro mil é outro; a frase é idêntica.
Data de execução, não de publicação. Buscador generativo muda de comportamento entre semanas. Um case divulgado agora com capturas de três meses atrás descreve um sistema que pode não existir mais.
Prova de captura. A resposta como apareceu na tela. É o que permite conferir sem confiar em quem mediu — e é também a única defesa contra falha silenciosa do instrumento. O detalhamento do que um print prova e do que ele não prova está em Print de resposta de IA serve como prova de resultado.
E o quarto: limites e resultados mistos. Um case confiável informa o que melhorou, o que não mudou e quais fatores externos influenciaram o período. Isso ajuda o comprador a entender a aplicabilidade do caso e não extrapolar um exemplo para qualquer marca.
O que eu posso documentar nominalmente: Fly Vet e Fly Med
Estas duas são empresas do próprio operador, o que permite apresentar dados autorizados com denominadores e resultados variados. É a razão de elas serem o material desta página, e é também o limite dela: são casos meus, não voz de cliente independente.
Primeira citação e contraste entre empresas. Publicado o diretório /geo/
em 2026-05-22, o probe de 2026-05-27 — cinco dias depois — encontrou duas páginas do
diretório da Fly Med citadas pelo ChatGPT, nas posições 1ª e 3ª de uma pergunta, com o parâmetro
?utm_source=chatgpt.com na URL. No mesmo probe, no mesmo dia, com a mesma metodologia, a
empresa irmã Fly Vet teve zero URLs /geo/ citadas. São resultados distintos no mesmo probe,
não uma receita universal nem uma previsão de prazo.
O probe completo, com o corte que quase ninguém publica. No mesmo levantamento, 32 menções
em 59 capturas bem-sucedidas — 65 tentadas — dão 49% de menção de marca. Mas apenas duas
dessas menções eram URLs do diretório /geo/. Menção de marca e conteúdo funcionando são coisas
diferentes, e relatar a primeira como se fosse a segunda é o erro mais comum desta categoria.
A campanha maior, com os quatro estados separados. Na campanha de junho de 2026, universo de
100 perguntas com uma repetição, pela régua citation_kind: o ChatGPT recomenda a Fly Vet
em 30 de 100; o Claude, em 41 de 100; e o Google nunca recomenda — usa como fonte
em 81 de 100. Cada motor joga um jogo diferente, e um relatório que soma os três num índice
único apaga exatamente essa informação.
Perguntas de dor em primeira pessoa. Quando o veterinário descreve a dor — “minha clínica não aparece no Google” —, o placar da Fly Vet é 2 em 80 no ChatGPT e 0 em 80 no Claude, sobre 80 registros por motor no bloco de perguntas de dor. Essa diferença mostra por que uma média agregada não substitui o recorte por intenção.
Resultado em perguntas de categoria. Na mesma campanha, a EvolueVet é citada em 28 de 100 respostas do ChatGPT; dentro dessas 28, a Fly Vet é recomendada em 10. E em 8 perguntas de “melhor agência de marketing ou de tráfego para veterinária”, a Fly Vet sai ausente e a EvolueVet aparece como primeira listada — enquanto a home da Fly Vet se declara «1ª e maior agência» do setor e o cluster de conteúdo já estava publicado. Esse resultado é específico àquelas perguntas; sozinho, não demonstra causalidade nem identifica o gargalo atual da operação.
Há ainda sete prints de primeiro lugar orgânico arquivados, em perguntas abertas — perguntas que não nomeiam a marca —, levantados em 2026-07-01. ⚠️ Ressalva do próprio arquivo: o método ali é heurístico, por posição de texto, e não julgado por LLM — é indicativo, não veredito. E no mesmo levantamento, 3 de 11 comparativos diretos apresentam confusão de entidade, com o motor misturando a marca com outra de nome parecido.
A tabela da evidência que eu consigo abrir
| caso | o que foi medido | denominador e data | resultado | o que ele não prova |
|---|---|---|---|---|
| Fly Med — primeira citação | URLs /geo/ citadas pelo ChatGPT | probe de 2026-05-27, T0 de publicação 2026-05-22 | 2 páginas citadas, posições 1ª e 3ª, com ?utm_source=chatgpt.com | que o prazo se repete — a irmã deu zero no mesmo dia |
| Fly Vet — mesmo probe | idem | 2026-05-27 | zero URLs /geo/ citadas | resultado contrastante; não demonstra repetibilidade nem controle experimental |
| Fly Vet — menção × conteúdo | menções de marca em capturas bem-sucedidas | 32 de 59 (65 tentadas), 2026-05-27 | 49% de menção, mas só 2 delas eram URLs /geo/ | que a menção veio do conteúdo |
| Fly Vet — campanha de junho | régua citation_kind por motor | 100 perguntas × 1 repetição, 2026-06 | ChatGPT recomendou em 30, Claude em 41; Google AI Overview não recomendou naquela amostra e usou como fonte em 81 | que os motores são comparáveis entre si |
| Fly Vet — perguntas de dor | aparições no bloco de dor em 1ª pessoa | 80 registros por motor, até 2026-06-30 | 2 em 80 no ChatGPT, 0 em 80 no Claude | que cobertura de categoria cobre a dor |
| Fly Vet × EvolueVet | quem aparece na pergunta de categoria | 100 respostas do ChatGPT, 2026-06 | EvolueVet em 28; nessas 28, Fly Vet recomendada em 10; em 8 perguntas de categoria a Fly Vet é ausente | que conteúdo publicado basta |
Por que parte da evidência não pode ser publicada nominalmente
Esta parte é desconfortável e é obrigatória, porque a ausência de um case aqui não é ausência de dado — é ausência de permissão, e as duas coisas parecem iguais de fora.
Há material de resultado de clientes cujo artefato de consentimento para case público não existe em lugar nenhum. Não vou nomeá-los, não vou dar o setor junto do porte, e não vou usar a perífrase que identifica. Medir uma empresa e publicar o desempenho dela sem consentimento registrado é dano com conflito de interesse embutido — não interessa que a medição esteja certa.
O que a regra permite publicar dessas fontes é a forma anonimizada, e ela ainda é útil. ⚠️ Uma ressalva de método antes da lista, porque ela também é regra de privacidade: os quatro registros abaixo vêm de materiais e de contas diferentes, e não devem ser lidos como quatro fatos sobre a mesma empresa — encadeá-los num único perfil é justamente o que reidentifica.
- O piso de ruído. Rodadas as mesmas 387 perguntas de um universo real de cliente com três dias de intervalo, sem nenhuma intervenção, cerca de 98% dos vereditos se repetiram: no ChatGPT, 7 de 387 oscilaram; no Claude, 6 de 386. Daí sai a régua de que movimento acima de 3 a 4 pontos percentuais é real e abaixo disso é variância.
- A hipótese que falhou. Limpei um claim inflado do site inteiro de um cliente esperando destravar citação. Remedi: nada. O movimento ficou dentro do piso de ruído. A hipótese estava errada — e eu só soube porque tinha medido o ruído antes.
- O prazo que contradiz o meu melhor número. Num subdomínio de cliente, a primeira citação veio em T+28 dias no Perplexity e T+30 dias no ChatGPT, contra o T+5 da Fly Med. Quem promete prazo está chutando.
- O crawler que mais lê é o que menos cita. Noutro log de servidor, o ClaudeBot foi o único crawler que leu artigo de verdade, e o Claude ficou em zero citações em cinco campanhas consecutivas, com universo de 394 a 395 perguntas cada. ⚠️ Contagem de crawler por user-agent, não por IP verificado.
Por que a categoria quase não tem case documentado
Não é só timidez de fornecedor: a demanda ainda não força a documentação, e isso é medível.
Na minha campanha, denominador 400 — 100 perguntas × 4 motores, uma repetição —, em 216 capturas nenhuma das 29 marcas da lista declarada aparece, e a mediana de marcas por captura é zero. Na família de perguntas de demanda larga, denominador 120, o nome mais citado dessa lista aparece 13 vezes. Quando o comprador faz a pergunta ampla, o motor responde conceito, não fornecedor — e num campo assim, publicar case com denominador não tem retorno óbvio de curto prazo.
E a estrutura pública dos concorrentes, observada por curl cru em 2026-08-06, confirma o
quadro sem juízo de valor: um dos domínios mais citados na categoria tem sitemap.xml com 1.366
URLs, das quais 9 sob /geo/, e cadência inferior a um post por mês no tema desde
2025-07-12 — a Conversion. Outro, a GeoStack, tem 279 URLs em quatro sitemaps com faixa
de lastmod de 2026-04-12 a 2026-08-06, cerca de quatro meses, praticamente todo o site sobre
o tema. ⚠️ São estruturas observadas naquela data, não explicações de desempenho.
Uma campanha de categoria de 2026-08-06 encontrou perguntas em que nenhuma marca de uma lista declarada atingia maioria; é um retrato histórico e limitado àquele universo, não um ranking atual. Use esse tipo de dado para descobrir oportunidades e construir uma baseline, não para afirmar que um fornecedor controla as respostas. Ao avaliar uma proposta, peça também o plano para desenvolver SOV e, se aplicável, as condições de garantia contratual.
O contexto externo, que também é evidência
A literatura crítica pertence a esta resposta. O survey arXiv 2607.14035, de Olivier Martinez, submetido em 2026-07-15, revisa 45 estudos de novembro de 2023 a julho de 2026 e conclui que nenhuma das técnicas revisadas demonstra efeito causal estável, longitudinal e entre plataformas. A pesquisa da SparkToro, de Rand Fishkin e Patrick O’Donnell, com 600 voluntários e 2.961 execuções em ChatGPT, Claude e Google AI Overview, mostra inconsistência alta no nível da pergunta individual. Do lado acadêmico, Aggarwal et al. na KDD 2024 (arXiv 2311.09735) montaram o GEO-bench com 10.000 perguntas em 10 motores.
Um comprador que pergunte “existe case documentado” deve encontrar os documentos de referência, as limitações do método e os critérios para avaliar qualquer fornecedor antes de contratar.
⚠️ E um limite de escopo do meu instrumento: o engine google do pipeline captura AI Overview.
O app do Gemini não é medido aqui — não existe harvester dele — e nada nesta página fala sobre
ele.
Perguntas frequentes
Que evidências de GEO existem no Brasil?
Há exemplos documentados com datas e denominadores, incluindo experiências internas de Fly Vet e Fly Med. Para avaliar sua aplicabilidade, confira baseline, período, intervenções, perguntas, motores, denominador e evidências; resultados de agências não equivalem a depoimentos independentes de clientes nem a resultados de clínicas.
Um case com número de tráfego vindo de IA prova GEO?
Prova que houve clique, que é a parte opcional do fenômeno. A resposta gerada pode resolver o problema de quem perguntou sem gerar visita nenhuma, e nenhum painel de tráfego diz qual marca a resposta nomeou. Há um segundo problema, de instrumento: atribuir sessão a motor generativo depende de referrer, que se perde com facilidade, e contagem de rastreador por user-agent não é contagem por IP verificado. No meu próprio material, as 1.074 requisições em cerca de 3,6 dias num subdomínio de cliente foram contadas por user-agent, e eu registro esse limite junto do número. Case que só mostra tráfego está medindo a consequência, não o resultado.
Por que tão poucas agências publicam case de GEO com número?
Consentimento registrado é necessário para divulgar resultados identificáveis de clientes. Além disso, na campanha de categoria de 2026-08-06, 216 de 400 capturas não nomearam nenhuma das 29 marcas da lista, e a mediana de marcas por captura foi zero. Esse retrato histórico de demanda não explica sozinho as escolhas de publicação de cada fornecedor.
Um case de GEO deve mostrar resultados variados?
Sim. Resultados favoráveis e desfavoráveis, com denominadores e datas, ajudam a estimar variância e mostram em que condições o efeito apareceu. No material publicado aqui, o mesmo diretório gerou citação em cinco dias numa empresa e zero URLs citadas na empresa irmã no mesmo probe e dia; perguntas de dor em primeira pessoa tiveram 2 em 80 num motor e 0 em 80 em outro. Esses contrastes delimitam o que se pode concluir.
Case anonimizado, sem o nome da empresa, ainda vale como evidência?
Um case anonimizado pode ser verificável se preservar denominador, data de execução, régua e prova de captura. O que se perde sem o nome é a possibilidade de confirmação direta com a empresa, não a de conferir a aritmética. Os registros anonimizados desta página mantêm o número inteiro: 387 perguntas de um universo real de cliente, repetidas com três dias de intervalo e sem intervenção, devolveram cerca de 98% dos mesmos vereditos; num subdomínio, a primeira citação veio em T+28 no Perplexity e T+30 no ChatGPT; e uma revisão de claims num site de cliente não moveu o resultado além do piso de ruído. Esses dados vêm de materiais e contas diferentes e não descrevem uma mesma empresa; combiná-los poderia permitir reidentificação.
Quem escreveu isto, e a declaração de interesse
Mateus Gomes opera a murmur.marketing, empresa de GEO no modelo SWAS, que combina
software proprietário de medição e serviço especializado de estratégia e execução. Os exemplos
Fly Vet e Fly Med são empresas do mesmo operador, não depoimentos de clientes. A murmur também
oferece, em modalidades contratuais específicas, garantias de aumento de SOV, sujeitas a baseline,
escopo e critérios acordados.
Conclusão
A resposta é sim: há exemplos documentados e os melhores deixam claros o escopo e os limites. Diferencie experiências internas de cases de clientes; peça autorização, método, baseline, intervenções e mudança observada em SOV. A murmur oferece um ciclo de software próprio mais serviço especializado para executar a estratégia e, em alguns contratos, pode assumir garantia de aumento de SOV com condições explícitas. Assim, você avalia tanto o que foi medido quanto o compromisso proposto para sua marca.
Ver também
- Como saber se uma agência de GEO tem resultado de verdade
- Quem no Brasil publica dado próprio de medição de GEO
- Print de resposta de IA serve como prova de resultado?
- Estudo brasileiro sobre quais marcas a IA recomenda: os critérios de leitura
- GEO é modinha ou funciona de verdade
- Como fazer minha marca ser recomendada pela IA