llms.txt virou assunto de reunião de marketing antes de virar padrão. A proposta existe, é pública e é barata de implementar. O que ela não é: uma exigência dos provedores de IA. O Google afirma, na documentação de recursos de IA para sites, que você não precisa criar arquivos legíveis por máquina, arquivos de texto para IA nem marcação especial para aparecer nas Visões Gerais Criadas por IA e no Modo IA. Quem decide o acesso dos motores ao seu conteúdo hoje é outro arquivo, bem mais antigo, chamado robots.txt.

H1única seção obrigatória do arquivo llms.txt (proposta llms.txt)
0arquivos de texto para IA exigidos pelo Google para AI Overviews e AI Mode (Google Search Central)
5agentes nomeados de ChatGPT e Perplexity a decidir no robots.txt (OpenAI e Perplexity, 2026)
Em resumo
  • llms.txt é uma proposta com formato definido, não um padrão adotado pelos provedores de LLM.
  • O Google diz que não é preciso criar arquivo de texto para IA nem schema especial para aparecer nos recursos de IA.
  • O que muda o resultado é qual crawler você libera no robots.txt, um a um, pelo nome.
  • Publicar llms.txt custa uma hora e pode ajudar agentes. Faça depois de acertar o robots.txt.

O que a proposta llms.txt define, exatamente

Origem aproximada do tráfego vindo de IA (Ahrefs, 2025)
ChatGPTChatGPT: 50%50%PerplexityPerplexity: 33%33%GeminiGemini: 18%18%Demais chatbots somadosDemais chatbots somados: 2%2%
Ver dados
ItemValor
ChatGPT50%
Perplexity33%
Gemini18%
Demais chatbots somados2%

A proposta sugere um arquivo em /llms.txt na raiz do site, ou em qualquer path, cobrindo as páginas abaixo dele. Um arquivo em /docs/llms.txt cobre a área /docs/. O formato é markdown com uma ordem obrigatória.

  • H1 com o nome do projeto. É descrito como a única seção obrigatória do arquivo.
  • Blockquote com um resumo curto do que é o site ou a área coberta.
  • Conteúdo opcional em markdown sem headings, para contexto adicional.
  • Seções delimitadas por H2, cada uma contendo uma lista de arquivos.

Cada item da lista de arquivos precisa de um hyperlink markdown no formato de nome entre colchetes seguido da URL entre parênteses. Depois do link, opcionalmente, dois-pontos e uma nota sobre aquele arquivo. A proposta também recomenda publicar versões markdown limpas das páginas, acrescentando .md ao endereço ou trocando a extensão, descobríveis por um link com rel alternate e tipo text markdown.

A parte incômoda: é proposta, não padrão

A própria proposta se apresenta como proposta e não como padrão adotado oficialmente pelos provedores de LLM. Do outro lado, a documentação do Google sobre recursos de IA e seu site é explícita: para ser elegível como link de apoio em AI Overviews ou no AI Mode, a página precisa estar indexada e elegível para aparecer na Pesquisa com snippet, cumprindo os requisitos técnicos da Busca. Não há requisitos adicionais nem otimizações especiais necessárias.

O mesmo documento acrescenta que você não precisa criar novos arquivos legíveis por máquina, arquivos de texto para IA ou marcação para aparecer nesses recursos, e que não existe dado estruturado especial de schema.org para isso. Se alguém oferecer à sua loja um pacote pago de llms.txt prometendo entrada garantida no AI Mode, essa é a frase para levar à reunião.

O que realmente controla o acesso: robots.txt e os crawlers pelo nome

A decisão que muda resultado é qual robô você libera. Cada provedor publica os nomes dos seus agentes e o que cada um faz, e eles servem a propósitos diferentes.

AgentePara que serveDecisão
OAI-SearchBotExibir sites nos resultados de busca do ChatGPTBloquear tira você da busca do ChatGPT
GPTBotRastrear conteúdo que pode ser usado em treino de modelosBloquear sinaliza recusa ao treino
ChatGPT-UserVisita acionada por um usuário que perguntouAs regras de robots.txt podem não se aplicar
PerplexityBotExibir e linkar sites nos resultados da PerplexityRespeita robots.txt e não é usado para treinar modelos
Perplexity-UserBusca acionada por ação do usuárioEm geral ignora as regras de robots.txt

A leitura executiva é direta. Bloquear treino e liberar busca são duas decisões separadas, e dá para tomar uma sem a outra. No universo Google, o token Google-Extended no robots.txt limita treino e grounding em outros sistemas do Google, sem afetar a indexação normal da Busca. Para conteúdo de snippet, existem ainda os controles nosnippet, data-nosnippet, max-snippet e noindex.

Detalhe operacional útil para quem cuida do firewall: a Perplexity publica as faixas de IP dos seus dois agentes em arquivos JSON, para configuração de WAF e verificação de identidade. Peça isso ao responsável de infraestrutura antes de criar regra de bloqueio por reputação, porque bloqueio errado derruba a sua presença sem aviso.

A decisão de segunda-feira

Abra o robots.txt do seu site e responda três perguntas com o dono do negócio: você quer aparecer na busca do ChatGPT e da Perplexity, quer que o seu conteúdo entre em treino de modelo e quer manter grounding do Google. Registre a resposta em ata, escreva as regras por agente nomeado e revise a cada semestre.

Depois disso, se sobrar uma hora, publique um llms.txt seguindo o formato da proposta, listando as páginas que você quer que um agente leia primeiro: catálogo, política de troca, prazos de entrega, guias fiscais. Custa pouco, pode ajudar agentes que decidam consumir o arquivo e não substitui o trabalho de conteúdo descrito em entidade e autoria.

Decidir o acesso dos agentes
Abrir robots.txtDecidir buscaDecidir treinoListar páginasPublicar llms.txt
Ver etapas em texto
  1. Abrir robots.txt
  2. Decidir busca
  3. Decidir treino
  4. Listar páginas
  5. Publicar llms.txt

Como a Onclick ajuda

Um llms.txt só é útil se apontar para páginas que existem e estão corretas. No varejo, as páginas que um agente mais procura são catálogo, disponibilidade e regras fiscais, e esses três dados vivem no sistema de gestão. O ERP Onclick guarda cadastro e parametrização fiscal, o PDV Web registra a emissão de NFC-e no balcão e a APIECOMM sincroniza estoque e pedidos com marketplaces e e-commerce, mantendo a informação pública alinhada com a real.

Na prática: gere a lista de categorias e políticas a partir do ERP Onclick, publique cada uma como página estável no seu domínio e só então liste esses endereços no llms.txt. Assim o arquivo aponta para conteúdo vivo, e a decisão de liberar ou bloquear crawler passa a valer sobre material que representa a operação de verdade.

Perguntas frequentes

llms.txt é obrigatório para aparecer em respostas de IA?

Não. A proposta llms.txt se apresenta como proposta, e não como padrão adotado oficialmente pelos provedores de LLM. Do lado do Google, a documentação de recursos de IA e seu site afirma que, para ser elegível como link de apoio em AI Overviews ou no AI Mode, a página precisa estar indexada e elegível para aparecer na Pesquisa com snippet, cumprindo os requisitos técnicos da Busca, e que não há requisitos adicionais nem otimizações especiais. O texto acrescenta que você não precisa criar arquivos legíveis por máquina, arquivos de texto para IA ou marcação, e que não existe dado estruturado especial de schema.org para isso.

Se eu quiser publicar mesmo assim, qual é o formato correto?

A proposta define um arquivo em /llms.txt na raiz, ou em qualquer path, cobrindo as páginas abaixo dele: um arquivo em /docs/llms.txt cobre a área /docs/. A ordem é fixa. Comece com um H1 contendo o nome do projeto, descrito como a única seção obrigatória. Em seguida um blockquote com resumo curto. Depois, se quiser, conteúdo em markdown sem headings. Por fim, seções delimitadas por H2, cada uma com uma lista de arquivos. Cada item da lista exige hyperlink markdown, com o nome entre colchetes e a URL entre parênteses, e aceita dois-pontos seguidos de uma nota opcional sobre aquele arquivo.

O que são as versões .md das páginas?

É a segunda recomendação da proposta llms.txt: publicar versões markdown limpas das suas páginas, sem menu, banner e script, para que um agente leia o conteúdo direto. O caminho sugerido é acrescentar .md ao endereço da página, no formato pagina.html.md, ou trocar a extensão do arquivo. Essas versões ficam descobríveis por um link com rel alternate e tipo text markdown no cabeçalho da página original. Trate isso como projeto de quem cuida do site, com prioridade menor que o ajuste do robots.txt, porque a proposta ainda não é padrão adotado pelos provedores e o custo de manutenção recai sobre o seu time.

Então o que de fato controla o acesso da IA ao meu site?

O robots.txt com os crawlers nomeados. Pela documentação da OpenAI, OAI-SearchBot serve para exibir sites nos resultados de busca do ChatGPT, e bloqueá-lo tira o seu site desses resultados; GPTBot rastreia conteúdo que pode ser usado no treino dos modelos de fundação; ChatGPT-User visita a página quando um usuário pergunta, e como a ação parte do usuário as regras de robots.txt podem não se aplicar. Pela documentação da Perplexity, PerplexityBot serve para exibir e linkar sites nos resultados e não é usado para treinar modelos de fundação, respeitando robots.txt, enquanto Perplexity-User geralmente ignora essas regras.

Dá para recusar treino sem sumir da busca por IA?

Dá, porque são decisões separadas. No caso da OpenAI, bloquear GPTBot sinaliza que o conteúdo não deve ser usado em treino, e manter OAI-SearchBot liberado preserva a sua presença nos resultados de busca do ChatGPT. No caso do Google, o token Google-Extended no robots.txt limita treino e grounding em outros sistemas do Google. Para o comportamento do snippet existem ainda nosnippet, data-nosnippet, max-snippet e noindex. Faça uma reunião com o dono do negócio, decida cada linha, registre em ata e revise a cada semestre, porque nomes de agentes e políticas mudam.

Preciso me preocupar com bloqueio por IP ou firewall?

Vale conversar com quem cuida da infraestrutura antes de criar regra de bloqueio automática. A Perplexity publica as faixas de IP dos seus dois agentes, PerplexityBot e Perplexity-User, em arquivos JSON destinados a configuração de WAF e verificação de identidade. Sem essa lista, um filtro de reputação pode barrar o agente legítimo e derrubar a sua presença nos resultados sem que ninguém perceba por semanas. Combine o seguinte: a decisão de acesso fica no robots.txt, com regras por agente nomeado, e o firewall só bloqueia o que não estiver nas faixas oficiais publicadas pelo provedor.