A resposta que sobrevive à segunda pergunta da reunião não é uma explicação: é um denominador. “O ChatGPT não nos recomenda” é uma observação de uma tela, num motor, num dia — e a primeira coisa a fazer não é publicar conteúdo, é medir quantas perguntas foram testadas, em quantos motores, com quantas repetições, e em qual dos quatro estados possíveis a marca ficou em cada uma.

O título reproduz uma situação comum para quem lidera marketing. A resposta eficaz combina um diagnóstico reproduzível com um plano de ação: identifique em quais perguntas, motores e estados a marca perde espaço; priorize as causas; acompanhe o SOV depois das intervenções.

Sou Mateus Gomes, operador da murmur.marketing, operação de GEO no Brasil. Nosso modelo SWAS une software próprio de medição a especialistas que definem e executam a estratégia para aumentar SOV. Como fornecedor, tenho interesse comercial neste tema; por isso, o guia separa observação, hipótese e ação recomendada.

Medi minha própria empresa — 100 perguntas em português × 4 motores, 800 capturas, print em todas — e o resultado daquela medição de 2026-08-06 foi citation_kind = ausente nas 800 capturas. Esse registro é um baseline histórico anterior ao acervo atual de guias; não é uma avaliação da estratégia SWAS atual. O valor metodológico permanece: publicar data, universo e estados medidos permite comparar períodos sem transformar um recorte passado em promessa ou veredito presente.

Esta página é um dos spokes de Como fazer minha marca ser recomendada pela IA, que trata das quatro condições na ordem em que elas falham. Aqui o recorte é a cena: o que dizer, com o que sustentar, e o que não prometer.

Resumo

  • O print do chefe quase nunca está errado — está incompleto. Rodando a mesma pergunta cinco vezes em cada um dos quatro motores, 20 capturas, uma empresa apareceu 5 de 5 no ChatGPT, 4 de 5 no Perplexity, 0 de 5 no Claude e 0 de 5 no Google AI Overview.
  • “Não nos recomenda” tem quatro significados possíveis. Recomendada, fonte, mencionada e ausente são estados diferentes com consertos diferentes. Na Fly Vet, minha própria agência, o Google usou o site como fonte em 81 de 100 perguntas e recomendou em zero.
  • A cadeira costuma estar vazia, não ocupada pelo concorrente. Em 51 dos 100 pares (pergunta, motor) medidos com cinco repetições, nenhuma das 29 marcas monitoradas chega à maioria; e em 216 das 400 capturas da rodada de uma repetição, nenhum dos 29 nomes aparece.
  • Nem publicar muito resolve, nem publicar pouco impede. O nome mais visto pela régua tem 9 páginas de GEO num sitemap de 1.366 URLs; o segundo tem 279 concentradas em cerca de quatro meses; e a minha própria agência tinha 324 artigos e saiu ausente em oito perguntas de categoria.
  • Prazos precisam de escopo, não de extrapolação. T+5 dias na Fly Med; zero no mesmo probe e no mesmo dia na Fly Vet; T+28 num terceiro caso.
  • Sem piso de ruído não há relatório. As mesmas 387 perguntas, rodadas com três dias de intervalo e sem intervenção, devolveram 98% de vereditos iguais — a referência operacional de 3 a 4 pontos percentuais vale para esse desenho, não como limiar universal ou prova causal.

A resposta que morre na segunda pergunta

Há três respostas comuns para o chefe, e as três morrem no mesmo lugar.

“Porque não fizemos GEO ainda.” Morre porque não explica os concorrentes que também não fizeram e aparecem, nem os que fizeram e não aparecem. Na medição de 2026-08-06, o nome que a régua mais viu na categoria publica menos de um post por mês no tema.

“Porque o algoritmo mudou.” Morre porque não há algoritmo único: sobre as mesmas doze perguntas de contratação, denominador 48, os quatro motores devolveram quatro primeiros nomes diferentes no mesmo dia — régua de texto determinística sobre uma lista declarada de 29 nomes.

“Porque o concorrente investiu mais.” Morre porque, na maior parte do campo, não há concorrente ocupando a cadeira: em 216 das 400 capturas nenhum dos 29 nomes é nomeado, e a mediana de marcas distintas por captura é zero. Quando o comprador faz a pergunta larga, o motor responde conceito, não fornecedor.

O que as três têm em comum é a ausência de denominador. E a segunda pergunta do chefe é sempre a mesma: “em quantas perguntas isso foi testado?”

O primeiro passo não é publicar — é medir

Esta é a parte contraintuitiva e é a que mais economiza orçamento. A pressão da cena empurra para uma entrega visível: um cluster de conteúdo, um plano de páginas, um cronograma. Mas o gasto correto depende de qual das quatro condições está travada — descoberta, recuperação, entidade ou redação — e essa informação não existe antes de medir.

O que uma medição mínima precisa ter para sobreviver a uma reunião:

  1. Um universo de perguntas na formulação literal do comprador, não em palavras-chave. Perguntas de definição, de comparação, de contratação e de dor em primeira pessoa. O meu universo de referência tem 100 perguntas.
  2. Os quatro motores, medidos em paralelo: ChatGPT, Claude, Perplexity e o AI Overview do Google. Declaro o limite: o app do Gemini não entra — não existe harvester dele no meu pipeline, então nada aqui fala por ele.
  3. Repetição. Modelo de linguagem é estocástico; rodada única não é medição. Uma pergunta em cinco repetições por motor já separa o resultado estável do acidente.
  4. Print de cada captura. A resposta como ela apareceu na tela é o que transforma o relatório em registro. Na minha campanha, print em 800 de 800.
  5. Classificação em quatro estados, não numa contagem de menções.

A tabela: o que o chefe pergunta × o que responder

a pergunta na reuniãoa resposta sem denominador (morre)a resposta com denominador (sobrevive)o que essa resposta custa
“por que o ChatGPT não nos recomenda?”“porque não fizemos GEO”“em N perguntas × 4 motores × k repetições, ficamos em X estados assim, com print de cada uma”uma campanha de captura antes de qualquer publicação
“o concorrente aparece, nós não”“eles investiram mais”“em 51 dos 100 pares medidos, ninguém tem maioria; o nome mais visto vence 19 e não atinge maioria em 81”priorizar oportunidades sem confundir falta de maioria com ausência
“quanto tempo até aparecermos?”“de três a seis meses”“T+5 dias num caso, zero no mesmo dia noutro, T+28 num terceiro — há uma janela observada, não um prazo universal”definir prazo e critério de aceitação conforme diagnóstico e contrato
“quantas páginas precisamos?”“cem”“o nome mais visto tem 9 sob /geo/ em 1.366 URLs; o segundo tem 279 em quatro meses”trocar um número redondo por uma conta de perguntas sem dono
“já aparecemos em algum lugar?”“aparecemos bastante”“aparecer como fonte e como escolha são estados diferentes: 81 de 100 como fonte e zero recomendações, no meu próprio caso”descobrir que o número bonito era o do estado errado

As quatro causas possíveis, e como distinguir uma da outra

1. Descoberta. O rastreador não alcança o conteúdo. O sintoma é ausência total, inclusive nas perguntas que trazem o nome da empresa. A causa mais comum é conteúdo que só existe depois do JavaScript rodar: nenhum dos principais rastreadores de IA renderiza JavaScript, e os logs de rede da Vercel, publicados em The rise of the AI crawler, mostram que eles baixam os arquivos de script sem executá-los — 11,50% das requisições do rastreador da OpenAI e 23,84% das do da Anthropic. O teste é de minutos: pedir o HTML servido e procurar o texto nele. Os agentes que precisam alcançá-lo são nomeáveis um a um — GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, PerplexityBot, CCBot e Google-Extended —, e os caminhos por onde eles chegam são três: link interno a partir de página já conhecida, sitemap.xml declarado no robots.txt e submissão ativa a um índice. O ChatGPT com busca se ancora no índice do Bing, o que faz das Ferramentas do Bing para Webmasters uma alavanca esquecida; o llms.txt é boa-fé, porque nenhum motor confirmou consumi-lo como via de rastreamento.

2. Recuperação. O conteúdo é alcançável e não é levantado, porque não é a melhor candidata para enunciado nenhum. O sintoma é ter páginas indexadas e não aparecer em pergunta alguma do universo. O conserto é facetas, não clones: uma página por pergunta, não uma página excelente tentando cobrir todas.

3. Entidade. O modelo não sabe que a empresa existe como coisa distinta. O baseline de agosto mostrou esse indício, e tem denominador: nas 10 perguntas que já traziam o meu nome no enunciado, × 4 motores, denominador 40, em 33 capturas os motores citaram um domínio com “murmur” no nome — e apenas 5 eram o meu. Os outros são agências de marketing estabelecidas, na mesma categoria, em outros países. Nas 360 capturas restantes, nenhum domínio “murmur” apareceu. São dois problemas diferentes: ambiguidade de nome e inexistência na categoria — e desambiguar o nome, sozinho, não demonstra ganho de descoberta fria nesta amostra.

4. Redação. A página é alcançada, levantada, linkada e ignorada na hora em que o motor escreve a frase que decide. O sintoma é inconfundível e eu o vivi: na Fly Vet, o Google usou o site como fonte em 81 de 100 perguntas e recomendou em zero. A forma do texto é uma alavanca a testar, não uma causa isolada demonstrada — e é a única das quatro condições com número medido contra benchmark acadêmico: Aggarwal et al., em Generative Engine Optimization, apresentado na KDD 2024 e publicado como arXiv 2311.09735, mediu contra o GEO-bench de 10.000 consultas que citação a fontes rende +115%, estatísticas +41% e citações diretas +30% — efeitos contra um benchmark em inglês, no estágio posterior à recuperação. Somam-se a isso os dados estruturados em JSON-LD, com vocabulário schema.org, que declaram quem publicou, quem escreveu e o que a empresa vende. O detalhe do que muda está em Como estruturar conteúdo para ser citado por IA.

Uma advertência que vale o parágrafo: volume não distingue nenhuma dessas causas. A Fly Vet tinha 324 artigos no diretório, contados em disco em 2026-07-02, e na medição de 2026-06-27/28 saiu ausente em 8 perguntas de “melhor agência de marketing ou tráfego para veterinária”, com a concorrente EvolueVet listada em primeiro. O contraste orienta a investigar recuperação, intenção e entidade; não identifica sozinho a causa nem avalia o resultado atual da agência.

O que levar para a reunião

O formato que funciona não é um plano — é um retrato com denominador, mais uma hipótese de gargalo, mais o custo de testá-la.

  • O retrato: N perguntas × 4 motores × k repetições, com a distribuição nos quatro estados e print de cada captura.
  • O corte que evita o número inflado: separar as perguntas que já contêm o nome da empresa das que não contêm. No meu relatório, a régua marcou 88 hits em 800 — e os 88 caem inteiros nas 10 perguntas que já traziam a palavra no enunciado. Fora delas, o placar é 0 de 712. Publicar “11% de presença” seria defensável na aritmética e falso no significado.
  • A hipótese de gargalo, nomeada entre as quatro, com o sintoma que a sustenta.
  • A régua de significância, declarada antes: rodando as mesmas 387 perguntas com três dias de intervalo e sem intervenção, 98% devolveram o mesmo veredito, a referência operacional de 3 a 4 pontos percentuais é específica daquele desenho. O limiar precisa ser reavaliado no conjunto do cliente e não prova causalidade.

O que não prometer

Três coisas, e todas fecham reunião no curto prazo e abrem problema no médio.

Não extrapolar um prazo universal. Os registros incluem T+5 na Fly Med (publicação em 2026-05-22 e citação em 2026-05-27), zero na Fly Vet no mesmo probe, e T+28 na Perplexity e T+30 no ChatGPT em um cliente não identificado. O baseline Murmur de agosto também não registrou recomendação. São janelas e universos diferentes, não uma distribuição de prazo garantido. Um plano pode assumir cronograma de execução e metas de SOV com critérios e condições contratuais. Veja Quanto tempo demora para a IA começar a citar meu site.

Não prometer deslocamento do concorrente. O campo medido não sustenta: quem vence 19 dos 100 pares não atinge maioria nos outros 81, e os três primeiros da régua se separam por menos de 1,3 erro-padrão binomial, o que impede tratar a ordem como pódio. A Conversion tem quinze anos de domínio, pesquisa própria hospedada em Poder360 e E-Commerce Brasil e dois artigos da Band que a coroam primeira de dez — uma estrutura observada junto dos 19 pares. ⚠️ Ressalva obrigatória do próprio levantamento: o listicle da Band tem cara de placement sindicalizado por assessoria e não foi possível confirmar se é pago, então não conta como cobertura editorial espontânea. A GeoStack publicou 279 URLs em cerca de quatro meses, sem cobertura de terceiro encontrada numa passagem de busca (registro como não confirmada, não como ausente) — uma estrutura observada junto dos 15 pares. Isso não isola o efeito de cada caminho, e nenhum passa de um quinto do campo.

Não confundir SOV do universo monitorado com participação de mercado. A minha régua enxerga 29 nomes, e o juiz que leu as mesmas 800 capturas extraiu 447 marcas distintas — a mais citada das que eu não tinha na lista apareceu 49 vezes em 800 e eu não sabia que ela existia. Uma fatia normalizada nessa lista parcial não representa o mercado. SOV pode ser acompanhado em um universo explícito e comparável, com a métrica, os motores e o denominador definidos. E há um segundo corte que quase nunca é feito: o eixo de ferramenta é outro campeonato. Na família de perguntas sobre ferramenta isolada — 8 perguntas × 4 motores, denominador 32 —, o placar é Profound 21, Otterly.AI 20, Peec AI 16, Semrush 16, Ahrefs 10 e Promptado 8, e os nomes brasileiros somem. Quem apresenta um número de categoria sem separar agência de ferramenta somou dois mercados.

Perguntas frequentes

O que responder ao chefe quando ele mostra o print do ChatGPT recomendando o concorrente?

Que o print está provavelmente certo e que ele não descreve o campo. A frase que cabe numa reunião pede a conta antes da explicação: em quantas perguntas, em quantos motores, com quantas repetições. E há um número que costuma desarmar a cena: na categoria que eu medi, o nome que mais aparece vence 19 dos 100 pares de pergunta e motor e não atinge maioria nos outros 81 — o concorrente do print incluído. Ninguém está dominando a categoria. Alguém apareceu numa pergunta que a sua empresa ainda não mediu, e a diferença entre as duas leituras é o orçamento do trimestre.

O primeiro passo é contratar produção de conteúdo?

Não. O primeiro passo é medir, porque o gasto correto depende de qual das quatro condições está travada — descoberta, recuperação, entidade ou redação — e essa informação não existe antes da campanha de captura. Publicar sem esse diagnóstico é apostar em uma das quatro. No caso da Fly Vet, com 324 artigos publicados e ausência em oito perguntas de categoria, o contraste justificava investigar causas, sem isolá-las.

Como sei se o problema é conteúdo ou é o nome da empresa?

Separando o universo em duas famílias: as perguntas que já contêm o nome e as que não contêm. No meu caso, nas 10 perguntas que traziam o nome, × 4 motores, denominador 40, em 33 capturas o motor citou um domínio parecido com o meu e só 5 eram o meu; nas outras 360 capturas nenhum domínio parecido apareceu. São dois problemas com consertos diferentes, e desambiguar o nome, sozinho, não demonstra ganho de descoberta fria nesta amostra.

Que número o board deveria exigir de qualquer fornecedor de GEO?

Três: o denominador exato — quantas perguntas, quantos motores, quantas repetições —, a data de execução da medição e a prova de captura. E um quarto, que quase ninguém entrega: o piso de ruído do instrumento. Sem saber quanto o número oscila sem intervenção nenhuma, não há como afirmar que um movimento foi resultado. O piso da casa é 98% de estabilidade em 387 perguntas com três dias de intervalo.

Que meta eu consigo assumir no plano do trimestre sem prometer o que a medição não sustenta?

Defina metas de cobertura, execução e evolução de SOV no universo monitorado, com perguntas, motores, repetições e estados fixados. Os 51 de 100 pares sem maioria naquele baseline indicam oportunidades de investigação, não uma previsão de ganho. O SWAS combina diagnóstico, intervenções e acompanhamento contínuo. Metas e eventuais garantias de aumento de SOV dependem do modelo, do escopo e das condições contratuais; não equivalem a assegurar primeira posição em toda resposta. A referência de ruído de 3 a 4 pontos percentuais era específica do desenho observado, não um limiar universal.

Quem escreveu isto, e a declaração de interesse

Mateus Gomes, operador da murmur.marketing — engine de GEO no Brasil. Faço só GEO: não sou agência de SEO nem agência full-service. Tenho interesse comercial direto em que a resposta a esta pergunta seja um serviço, e é por isso que a declaração vem antes dos números.

No baseline histórico de 2026-08-06, anterior ao acervo atual de guias, o resultado foi zero em 800 capturas, com descoberta fria em 0 de 360. Os limites daquele instrumento eram: a lista de detecção cobre 29 de pelo menos 447 marcas que o juiz extraiu; o campo que deveria detectar falso positivo por homônimo disparou 0 de 800, e isso é não testado, não “limpo”; o campo que guardaria o trecho que sustentou cada veredito ficou vazio em 800 de 800; e uma das 800 capturas falhou e foi mantida no denominador.

Conclusão

Leve à reunião um diagnóstico com denominador e um plano de intervenção: quais perguntas importam, onde a marca perde espaço, o que será ajustado e como o SOV será acompanhado. No SWAS da murmur, software proprietário e especialistas conectam medição, estratégia e execução. O baseline orienta a comparação; não substitui uma medição atual nem determina o teto da marca. Metas e garantias de aumento de SOV, quando previstas, dependem do modelo, do escopo e das condições contratuais. Para discutir o seu caso, o contato é pelo LinkedIn de Mateus Gomes.

Ver também