Nesta página
llms.txt ajuda quem tem loja, catálogo e políticas publicadas no site. A proposta organiza links para robôs de leitura, mas o acesso real passa pelo robots.txt, a placa na porta do site para robôs de busca. No cenário desta página, uma loja de roupa decide quais páginas mostrar primeiro.
- llms.txt é uma proposta com formato definido, sem garantia de adoção por todos os provedores.
- O Google dispensa arquivo de texto para IA e marcação especial nesses recursos de busca.
- O robots.txt controla o acesso por robô nomeado, um por um.
- Publique llms.txt depois de revisar o robots.txt e listar páginas úteis.
Para que serve llms.txt no seu site?
Ver dados
| Item | Valor |
|---|---|
| ChatGPT | 50% |
| Perplexity | 33% |
| Gemini | 18% |
| Demais chatbots somados | 2% |
A proposta coloca um arquivo em /llms.txt na raiz do site. Também permite um arquivo dentro de uma pasta, como /docs/llms.txt, para cobrir só aquela área. O formato usa markdown, texto simples como lista limpa no balcão.
- H1 com o nome do projeto. É o título principal do arquivo.
- Linha de resumo curto. Ela explica o site ou a área coberta.
- Texto opcional em markdown. Ele dá contexto sem criar novos títulos.
- Seções com H2. Cada seção reúne uma lista de arquivos importantes.
Cada item da lista precisa ter um link em markdown, com nome entre colchetes e endereço entre parênteses. Depois do link, a proposta aceita dois-pontos e uma nota curta sobre a página.
No cenário da loja de roupa, o arquivo pode apontar para categorias, política de troca e tabela de medidas. Essas páginas ajudam um robô a responder perguntas sem procurar o site inteiro.
O Google pede esse arquivo para aparecer na IA?
A documentação do Google sobre recursos de IA para sites dá uma resposta prática. Para aparecer como link de apoio nas Visões gerais de IA ou no Modo IA, a página precisa estar na Pesquisa e poder mostrar snippet, o trecho no Google como etiqueta da vitrine.
O Google também afirma que dispensa novos arquivos legíveis por máquina, arquivos de texto para IA e marcação especial. Por isso, um pacote de llms.txt com promessa de entrada garantida nesses recursos deve ser tratado como risco comercial.
Para a loja de roupa, a prioridade fica clara. O catálogo precisa abrir, carregar bem e ter páginas indexáveis. Depois disso, o llms.txt pode organizar os links principais para quem decidir usar esse arquivo.
Quem libera ou bloqueia os robôs?
A decisão que muda o acesso fica no robots.txt. Cada provedor publica nomes de robôs, e cada nome cumpre uma função. Você pode liberar busca, recusar treino e manter regras diferentes para visitas acionadas pelo usuário.
| Agente | Para que serve | Decisão |
| OAI-SearchBot | Exibir sites nos resultados de busca do ChatGPT | Bloqueio tira o site da busca do ChatGPT |
| GPTBot | Rastrear conteúdo que pode ser usado em treino de modelos | Bloqueio sinaliza recusa ao treino |
| ChatGPT-User | Visita acionada por um usuário que perguntou | As regras de robots.txt podem perder efeito |
| PerplexityBot | Exibir e linkar sites nos resultados da Perplexity | Respeita robots.txt e não treina modelos |
| Perplexity-User | Busca acionada por ação do usuário | Em geral ignora as regras de robots.txt |
No Google, o token Google-Extended no robots.txt limita treino e grounding, uso de páginas como base, igual vendedor consultando catálogo. Ele preserva a indexação normal da Busca.
Para controlar o snippet, existem comandos como nosnippet, data-nosnippet, max-snippet e noindex. Esses nomes ficam para quem cuida do site, mas a decisão de negócio deve vir antes da regra técnica.
Se o site usa firewall, fale com a pessoa de infraestrutura antes de bloquear por reputação. A Perplexity publica faixas de IP, o endereço de internet do robô, em arquivos JSON, listas que o sistema lê sozinho.
O que a loja de roupa decide hoje?
A loja de roupa precisa separar três decisões. Ela quer aparecer na busca do ChatGPT e da Perplexity, recusar treino de modelos ou manter grounding do Google. Essas respostas viram linhas no robots.txt.
Registre a decisão em uma ata simples, com data, responsável e motivo. Depois, peça a regra por agente nomeado. Revise o arquivo a cada semestre, porque nomes de robôs e políticas podem mudar.
Depois da revisão, publique o llms.txt se houver uma hora disponível. Liste primeiro catálogo, política de troca, prazos de entrega e guias fiscais. O arquivo ganha valor quando aponta para páginas estáveis.
Ver etapas em texto
- Abrir robots.txt
- Decidir busca
- Decidir treino
- Listar páginas
- Publicar llms.txt
Esse caminho conversa com o trabalho de conteúdo descrito em entidade e autoria. O formato do arquivo e a validação rápida aparecem no guia prático de marcação para sistemas e llms.txt.
Como a Onclick mantém o conteúdo correto?
ERP Onclick e KPL são núcleos independentes, com bases próprias e sem comunicação entre si. O ERP atende pequenas e médias empresas conforme aderência; o KPL é um OMS para orquestrar pedidos de e-commerce de volume, com funções parciais de ERP, WMS e TMS.
APIECOMM e PDV Web complementam o ERP Onclick ou o KPL escolhido e não têm venda avulsa. Esses componentes não criam uma ponte entre os núcleos.
Os usos de IA descritos são possibilidades de análise e automação. A disponibilidade de dados no núcleo escolhido, as permissões de acesso e a integração com a ferramenta analítica precisam ser verificadas. Isso não constitui oferta de IA pronta, previsão automática ou protocolos de compra por agentes na Onclick.
Leve um fluxo real à avaliação e peça o escopo por escrito: núcleo, complementos, integrações, limitações e critério de aceite. Compare os critérios de escolha.
O que decidir agora
Abra o robots.txt da sua loja antes de qualquer outra coisa. Responda três perguntas. Você quer aparecer na busca do ChatGPT e da Perplexity? Aceita que o seu conteúdo vire treino de modelo? Quer manter o grounding do Google?
Registre a resposta em uma ata simples, com data, responsável e motivo. Depois peça a regra no robots.txt por agente nomeado, um por um. Marque a revisão para daqui a seis meses, porque os nomes dos robôs mudam.
Só então liste as páginas que valem a leitura de um robô: categorias, política de troca, prazos de entrega e guias fiscais. Com essa lista pronta, publicar o llms.txt na raiz do site cabe em uma hora de trabalho.
Quais dúvidas aparecem na hora de decidir?
llms.txt é obrigatório para aparecer em respostas de IA?
O Google afirma que a página precisa estar indexada e elegível para snippet na Busca. A proposta llms.txt pode ajudar alguns robôs, mas a documentação do Google dispensa esse arquivo nos recursos de IA.
Se eu quiser publicar mesmo assim, qual é o formato correto?
Comece com H1, o título principal do projeto. Depois coloque um resumo curto, texto opcional em markdown e seções com H2. Em cada seção, liste links em markdown para páginas importantes.
O que são as versões .md das páginas?
São cópias em markdown, sem menu, banner e script. A proposta sugere essas versões para leitura mais limpa. Trate isso como tarefa do site, depois da revisão do robots.txt.
O que de fato controla o acesso da IA ao meu site?
O robots.txt controla o acesso por robô nomeado. OAI-SearchBot e PerplexityBot servem para busca. GPTBot se liga ao treino. ChatGPT-User e Perplexity-User partem de ações do usuário.
Dá para recusar treino e aparecer na busca por IA?
Dá para separar as decisões. Você pode bloquear GPTBot e manter OAI-SearchBot liberado. No Google, Google-Extended limita treino e grounding em outros sistemas, sem mexer na indexação comum da Busca.
Preciso me preocupar com bloqueio por IP ou firewall?
Vale alinhar com quem cuida da infraestrutura. A Perplexity publica faixas de IP em arquivos JSON para confirmar a identidade dos robôs. Um bloqueio errado pode tirar o site dos resultados.