Pular para o conteúdo

Artigo 8 min de leitura

Como um assistente decide quem citar, e onde a sua página é eliminada

por Daniel Sócrates publicado em

Você pergunta ao ChatGPT qual empresa contratar para uma coisa que a sua empresa faz. A resposta vem com três nomes, e nenhum é o seu.

O primeiro impulso é achar que o modelo não conhece você. Às vezes é isso mesmo. Na maioria das vezes, o que aconteceu foi outra coisa, e ela começa antes de qualquer busca.

A pergunta que você faz não é a pergunta que ele responde

Antes de procurar qualquer coisa, o sistema reescreve o que você pediu.

Um pedido de patente do Google descreve o mecanismo. O trecho é este: “Additional/alternative queries may be, for instance, alternative query suggestions, supplemental queries, rewritten versions…”. Consultas adicionais, alternativas, complementares, reescritas. 1 2

Sua pergunta vira várias. Cada uma delas vai buscar do seu jeito, e cada uma volta com candidatos diferentes.

Uma observação sobre o documento, e ela importa. O pedido não usa a expressão “query fan-out”. O nome apareceu depois, na comunicação de produto. 3

O Google confirmou o termo em 20 de maio de 2025, no anúncio do I/O: “Under the hood, AI Mode uses our query fan-out technique”. 4 E confirmou em português, em 8 de setembro de 2025, quando o Modo IA chegou ao Brasil. 5

Isso se chama abertura de leque, ou query fan-out.

Três memórias na mesma cabeça

Um modelo tem três formas de saber alguma coisa, e elas funcionam diferente.

A primeira é o que ele estudou. Conhecimento que entrou no treino e ficou. A segunda é o que ele consulta na hora, indo buscar documento enquanto responde. A terceira é o que ele anotou sobre você durante a conversa.

A divisão em três é minha, e é didática. Os três mecanismos são reais e distintos, e juntar os três nessa figura é organização minha para facilitar a leitura. 6

A segunda memória tem nome e paper. Patrick Lewis e outros publicaram “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks” na NeurIPS de 2020, revisado por pares. 7

Daqui sai a consequência mais prática do artigo. O que você publica hoje não entra no que o modelo já estudou. Entra, na melhor das hipóteses, no que ele consulta na hora.

Três robôs, três crachás

Os robôs de quem

A OpenAI documenta seus rastreadores em página oficial. O GPTBot coleta conteúdo público que pode ser usado para melhorar e treinar os modelos. O OAI-SearchBot tem função distinta. 8

A Perplexity faz o mesmo. Na documentação dela, o PerplexityBot é descrito como “designed to surface and link websites in search results”, e a citação foi conferida em 1º de agosto de 2026. 9

O Google mantém a lista dos próprios rastreadores em Search Central, conferida na mesma data. 10

O que isso significa para o seu robots.txt

Três empresas, três documentações, três conjuntos de robôs com funções separadas.

A leitura de que cada sistema tem corpus e política de acesso próprios é minha, e ela se apoia nesses três documentos independentes. Nenhum deles diz isso sobre os outros. 11

Na prática, bloquear um robô de treino e bloquear um robô de busca são duas decisões diferentes. Quem trata as duas como uma só costuma sumir de um lugar onde queria estar.

Quatro portarias em fila

Chamo de portões as quatro etapas entre a sua página e a citação. A organização em quatro é minha. As etapas em si são engenharia conhecida: indexação, recuperação de candidatos, reordenação e geração com atribuição. 12

Portão 1: estar no corpus daquele sistema

O primeiro filtro não tem nada a ver com qualidade. Tem a ver com presença.

Se o rastreador daquele sistema nunca passou pelo seu site, ou passou e foi bloqueado, você não é candidato. Sintoma: a IA descreve o seu mercado com competência e nunca menciona a sua empresa, nem errado.

Portão 2: ter um trecho que responde sozinho

O sistema não recupera o seu site. Recupera um pedaço de texto.

Esse pedaço precisa fazer sentido fora do contexto. Se o parágrafo começa com “isso acontece porque”, ele depende do anterior, e sozinho não responde nada. Sintoma: o site tem autoridade no assunto e as citações vão para páginas mais fracas com respostas mais diretas.

Portão 3: sobreviver à reordenação

Os candidatos recuperados passam por uma segunda fila, que os coloca em ordem de novo.

Sintoma: você aparece em algumas respostas e some em outras, sobre o mesmo assunto, sem padrão aparente.

Portão 4: ser nomeado na atribuição

O último portão é o mais cruel, porque nele você já foi lido.

O sistema usou o seu conteúdo para compor a resposta e creditou outra fonte. Acontece quando o trecho não carrega dentro dele o nome de quem está falando. Sintoma: a resposta contém uma informação que só existe no seu site, e cita outro endereço.

A cronologia, para quem quer saber desde quando

O pedido de patente que descreve a abertura de leque foi depositado em 27 de fevereiro de 2024. A publicação saiu em 29 de agosto do mesmo ano. 1

Uma nota de régua: aquilo é um pedido, não uma patente concedida. Pedido mostra intenção de proteger uma ideia. Concessão mostra que o escritório examinou e aceitou. São degraus diferentes de evidência, e tratar um como o outro é o erro mais comum quando se cita patente do Google.

O Modo IA ficou disponível de forma geral nos Estados Unidos em 20 de maio de 2025. Chegou ao português do Brasil em 8 de setembro de 2025, três meses e meio depois. 13

A documentação técnica sobre recursos de IA e sites foi atualizada em 10 de dezembro de 2025. 14

O seu exercício de segunda-feira

Dez minutos, três abas.

Abra ChatGPT, Gemini e Perplexity. Em cada um, peça uma recomendação do que a sua empresa vende, sem citar o nome dela. Escreva como um cliente escreveria.

Anote quem foi citado no seu lugar. Não é para se comparar com eles em qualidade. É para descobrir em qual portão você parou, e os sintomas de cada portão estão na seção acima.

Guarde os três prints com a data. Sem eles, daqui a três meses você não vai conseguir dizer se alguma coisa mudou.

Perguntas frequentes

Dá para fazer engenharia reversa do ChatGPT?

Não do jeito que costuma ser vendido. Dá para conhecer as etapas públicas, os robôs documentados e o que as empresas declaram oficialmente. A divisão em três memórias deste artigo é organização didática minha, não descrição interna do sistema. 6

Bloquear o GPTBot tira minha empresa do ChatGPT?

São coisas separadas. O GPTBot coleta conteúdo que pode ser usado para treinar, e o OAI-SearchBot tem outra função. Bloquear um não é a mesma decisão que bloquear o outro. 8 11

“Query fan-out” é termo oficial do Google?

É termo oficial de comunicação de produto, usado no anúncio de 20 de maio de 2025. O pedido de patente que descreve o mecanismo não usa essa expressão. 3 4

Publicar hoje me coloca na resposta amanhã?

No que o modelo já estudou, não. O treino tem corte. O caminho possível é a memória de consulta em tempo de resposta, e ela depende dos quatro portões deste artigo. 6 7

Notas e fontes

  1. Pedido de patente US 2024/0289407 A1, “Search with stateful chat”, Google LLC. Depósito em 27 de fevereiro de 2024, publicação em 29 de agosto de 2024, prioridade de 28 de fevereiro de 2023. Pedido, não patente concedida.
  2. Trecho literal do pedido da nota 1, reproduzido no corpo.
  3. O texto do pedido da nota 1 não usa a expressão “query fan-out”. O nome vem da comunicação oficial de produto.
  4. Google, “AI Mode in Google Search: Updates from Google I/O 2025”, blog.google, 20 de maio de 2025. Citação literal reproduzida no corpo.
  5. Google Brasil, “Busca do Google: agora o Brasil já pode usar o Modo IA em português”, blog.google/intl/pt-br, 8 de setembro de 2025.
  6. As três memórias: divisão didática do autor. Os três mecanismos são reais e distintos, e a costura entre eles é organização do autor.
  7. Patrick Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks”, NeurIPS 2020. Paper revisado por pares.
  8. OpenAI, documentação oficial de bots e user agents, platform.openai.com/docs/bots. GPTBot coleta conteúdo público que pode ser usado para melhorar e treinar os modelos; OAI-SearchBot tem função distinta.
  9. Perplexity, “Bots”, docs.perplexity.ai/guides/bots. Citação literal verificada em 1º de agosto de 2026.
  10. Google Search Central, “Google crawlers”. Citações literais verificadas em 1º de agosto de 2026.
  11. Corpus e política de acesso por sistema: inferência do autor, apoiada nas notas 8, 9 e 10. Três documentações oficiais de três empresas independentes, nenhuma afirmando sobre as outras.
  12. Os quatro portões: organização do autor. As etapas descritas, indexação, recuperação de candidatos, reordenação e geração com atribuição, são engenharia conhecida.
  13. Cronologia: Modo IA disponível de forma geral nos Estados Unidos em 20 de maio de 2025; em português do Brasil a partir de 8 de setembro de 2025.
  14. Google Search Central, “AI features and your website”, atualizada em 10 de dezembro de 2025.

Daniel Sócrates

Fundador e CEO da SEO Genome

Autor de SEO de Entidade. Escreve sobre o que a casa aplica em cliente.

danielsocrates.com.br

Vamos ver o que a máquina entende da sua empresa

Uma conversa de diagnóstico, sem apresentação de slides. Você traz o endereço do seu site. A gente traz o que o Google e as IAs já sabem sobre ele hoje.

Falar no WhatsApp