Pular para o conteúdo

Série O DNA do Prompt 1 de 10 7 min de leitura

O DNA do Prompt 1 de 10: por que a arquitetura vem antes do texto

por Daniel Sócrates publicado em

Você escreve o texto primeiro e organiza depois. Quase todo mundo faz assim.

O problema é que a máquina lê na ordem inversa. Ela olha onde o trecho está antes de decidir o que o trecho vale.

Existe uma patente concedida que descreve isso, com as palavras exatas.

A máquina não entrega a sua página. Entrega um pedaço dela

Em 15 de outubro de 2020, no evento Search On, Prabhakar Raghavan anunciou uma mudança na forma como o Google trata conteúdo longo. A frase foi esta: “By understanding passages in addition to the relevancy of the overall page, we can find that needle-in-a-haystack information you’re looking for”. 1

Entender passagens, além da relevância da página inteira. A agulha no palheiro.

O recurso foi apresentado primeiro com um nome, passage indexing, e o próprio Google corrigiu depois para passage ranking. A correção não é detalhe de vocabulário. O sistema não indexa passagens em separado. Ele ranqueia passagens de páginas que já estão indexadas. 2

A diferença muda o que você faz. Não existe uma fila separada onde inscrever os seus melhores parágrafos. Existe a sua página indexada, e dentro dela pedaços que competem.

O anúncio foi em outubro de 2020. A entrada em produção veio em 10 de fevereiro de 2021, primeiro para buscas em inglês nos Estados Unidos. Três meses e vinte e seis dias entre uma coisa e outra. 3

Isso se chama ranqueamento em nível de passagem.

Como a máquina sabe de onde aquele pedaço veio

Se o sistema recorta um parágrafo do meio da sua página, ele precisa saber a que aquele parágrafo pertence. Sem isso, um trecho sobre preço fica igual a outro trecho sobre preço, em qualquer site, sobre qualquer coisa.

A patente US 9.959.315 B1, “Context scoring adjustments for answer passages”, do Google, foi depositada em 31 de janeiro de 2014 e concedida em 1º de maio de 2018. Está ativa. As reivindicações descrevem um sistema que recebe uma pergunta, identifica passagens candidatas dentro dos documentos, e determina a hierarquia de títulos daquele documento. 4

O documento nomeia o que faz com essa hierarquia. Ele monta um vetor definido como “a path in the heading hierarchy from the root heading to the respective heading”: um caminho na hierarquia de títulos, do título raiz até o título ao qual a passagem está subordinada. 5

E vem a parte que decide o assunto deste artigo. Esse caminho carrega o texto de cada nível de título por onde passa. 5

Pense num endereço. “Sala 12” não diz nada sozinho. “Edifício Central, sexto andar, ala sul, sala 12” diz tudo, e cada pedaço do endereço acrescenta informação.

Os seus títulos são esse endereço. O parágrafo herda o significado do caminho inteiro até ele.

O caminho não é o único componente

Seria cômodo parar aqui e transformar isso numa receita de títulos. A patente não permite.

O mesmo documento descreve outros componentes do ajuste de contexto. A profundidade do título dentro da hierarquia. A similaridade entre o texto da pergunta e o texto do título. A razão de cobertura da passagem. E a detecção de traços textuais distintivos, como uma pergunta imediatamente antes do trecho, ou o formato de lista. 6

São quatro coisas além do caminho, e elas convivem.

Quem cita só o caminho de títulos empobrece o mecanismo e vende arrumação de H2 como solução completa. A arquitetura importa porque é a camada que você controla melhor, e não porque é a única que existe.

Oito anos protegendo a mesma ideia

A família dessa patente teve continuação. A US 11.409.748 B1 tem o mesmo título e foi depositada em 16 de março de 2018. A prioridade é herdada de 31 de janeiro de 2014. A concessão saiu em 9 de agosto de 2022, e ela também está ativa. 7

De 2014 a 2022, a mesma linhagem de engenharia continuou sendo protegida.

O que as datas provam é a duração do investimento. Que a empresa esteja protegendo terreno que considera vivo é leitura minha, e nenhum documento afirma isso. 8

O prompt

Este é o prompt de arquitetura da série. Ele monta a hierarquia de títulos antes de qualquer parágrafo ser escrito.

bloco para copiar
Você é arquiteto de conteúdo semântico.

Vou te dar um assunto e o público. Antes de qualquer texto, monte a
hierarquia de títulos do artigo, do H1 até os H3.

Para cada título, escreva ao lado, entre colchetes:
1. a pergunta que aquela seção responde
2. o caminho completo do título raiz até ele
3. se o trecho daquela seção faz sentido lido fora do contexto

Regras:
- cada H2 responde a uma intenção diferente, sem sobreposição
- H3 só existe quando o H2 tem dois ou mais aspectos distintos
- nenhum título começa com "Entendendo" ou "Conhecendo"
- o nome do assunto aparece nos títulos onde ele é o sujeito

Não escreva o texto. Entregue só a arquitetura.

Assunto: [seu assunto]
Público: [quem lê]

Ele força a decisão de estrutura antes da escrita, e devolve o caminho de cada seção de forma explícita.

Uma coisa que ele não faz: garantir posição ou citação. E não substitui apuração. Ele organiza. O que vai dentro de cada seção continua sendo trabalho seu.

Perguntas frequentes

O Google indexa passagens separadamente?

Não. O recurso foi anunciado como passage indexing e o próprio Google corrigiu para passage ranking. Ele ranqueia passagens de páginas já indexadas. 2

Quantos níveis de título devo usar?

A patente não estabelece número. Ela descreve que o caminho carrega o texto de cada nível. E que a profundidade do título é um dos componentes do ajuste. Caminho longo demais dilui, caminho curto demais não localiza. 5 6

Isso funciona em português?

A entrada em produção começou em inglês nos Estados Unidos, em fevereiro de 2021, com expansão prevista para outros idiomas. O mecanismo descrito na patente não é específico de idioma, e a data de chegada a cada língua é outra conversa. 3

Notas e fontes

  1. Prabhakar Raghavan (Google), “How AI is powering a more helpful Google”, blog.google, 15 de outubro de 2020, evento Search On. Citação literal reproduzida no corpo.
  2. Correção do nome do recurso: o Google apresentou o lançamento primeiro como “passage indexing” e depois corrigiu para “passage ranking”, porque a descrição original não era exata. O sistema ranqueia passagens de páginas indexadas.
  3. Entrada em produção em 10 de fevereiro de 2021, primeiro para buscas em inglês nos Estados Unidos, com expansão prevista para outros países e idiomas. Do anúncio de 15 de outubro de 2020 até essa data: três meses e vinte e seis dias.
  4. Patente concedida US 9.959.315 B1, “Context scoring adjustments for answer passages”, Google LLC. Prioridade e depósito em 31 de janeiro de 2014, concessão em 1º de maio de 2018, status ativa.
  5. Definição literal de heading vector na US 9.959.315 B1, reproduzida no corpo. O vetor carrega o texto de cada nível de título do caminho.
  6. Componentes do ajuste de contexto na mesma patente, além do caminho de títulos: profundidade do título na hierarquia, similaridade entre o texto da pergunta e o texto do título, razão de cobertura da passagem, e detecção de traços textuais distintivos.
  7. Patente concedida US 11.409.748 B1, mesmo título, Google LLC. Depósito em 16 de março de 2018, prioridade herdada de 31 de janeiro de 2014, concessão em 9 de agosto de 2022, status ativa. Continuação do pedido de origem da US 9.959.315 B1.
  8. Leitura de intenção a partir da continuação: inferência do autor. O que as datas provam é a duração do investimento numa mesma linhagem de engenharia.

Daniel Sócrates

Fundador e CEO da SEO Genome

Autor de SEO de Entidade. Escreve sobre o que a casa aplica em cliente.

danielsocrates.com.br

Vamos ver o que a máquina entende da sua empresa

Uma conversa de diagnóstico, sem apresentação de slides. Você traz o endereço do seu site. A gente traz o que o Google e as IAs já sabem sobre ele hoje.

Falar no WhatsApp