A web agêntica e os dados de produto industriais

Publicado 2026-08-0911 min de leituraagentic web · crawlers · Cloudflare · Web Bot Auth

Em resumo

Como a web agêntica está mudando o que os fabricantes industriais precisam publicar?

A web está se separando em uma superfície humana, otimizada para navegadores, e uma superfície de máquina, otimizada para agentes — e as duas passaram a ser governadas de formas diferentes. O tráfego automatizado já supera o humano: a Imperva mediu 53% do tráfego da web como automatizado em 2025. E os provedores de infraestrutura agora o tarifam: a partir de 15 de setembro de 2026, a Cloudflare bloqueia por padrão os rastreadores de treinamento de IA e de agentes em páginas com publicidade, para sites novos e do plano gratuito, tendo o pay-per-crawl e a identidade de agente assinada criptograficamente como as alternativas emergentes ao bloqueio geral. Para um fabricante, a consequência prática é que ser rastreável já não é o mesmo que ser alcançável — e as empresas que se tornarem precisas e alcançáveis primeiro passam a ser a resposta padrão.

A web agora tem dois públicos, e só um deles tem olhos

Durante trinta anos, publicar na web significou publicar para uma pessoa com um mouse na mão. Tudo o que vinha depois — layout, frameworks JavaScript, banners de cookies, analytics, inventário de anúncios — pressupunha um ser humano do outro lado.

Nothing in the top row changes. The layer reads from what already exists and publishes it in the shapes agents actually request.

Essa premissa hoje é falsa com mais frequência do que é verdadeira. O Bad Bot Report 2026 da Imperva constatou que o tráfego automatizado respondeu por 53% de todo o tráfego da web em 2025, ante 51%, com o tráfego humano caindo para 47% e ainda em queda. A Cloudflare fez a mesma observação ao anunciar sua política de rastreadores para 2026: a maior parte do tráfego da internet não é humana.

A consequência interessante não é a proporção. É que os dois públicos agora são governados separadamente — regras de acesso diferentes, precificação diferente, exigências de identidade diferentes. A web está se bifurcando em uma superfície humana e uma superfície de máquina, e os fabricantes industriais não dedicaram tempo algum a pensar na segunda.

Por que a economia se quebrou?

A busca funcionava porque era uma troca. Um rastreador levava a sua página e devolvia visitantes. Os publishers aceitavam o acordo porque a taxa de câmbio era favorável.

A recuperação por IA quebrou essa taxa de câmbio. Em 2025, a Cloudflare começou a publicar no Radar as razões de crawl-to-refer — páginas rastreadas por referência enviada — e os números não chegavam perto da norma da busca, de umas poucas raspagens ou menos por visitante. Em uma amostra do fim de junho de 2025, o rastreador da Anthropic estava em cerca de 70.900 páginas rastreadas por referência. A Cloudflare também informou, em 2026, que mais da metade do tráfego de rastreio de IA é gasta rebuscando páginas que não mudaram.

Enquanto isso, o lado humano da troca definhou por conta própria. A SparkToro mediu que 68% das buscas do Google nos EUA terminaram sem clique no início de 2026, com cerca de 276 cliques por 1.000 buscas chegando à web aberta, ante 374 em 2024.

Assim, os publishers enfrentaram extração crescente e remuneração decrescente, e fizeram o previsível.

Mas repare bem que essa lógica é específica de negócios cujo conteúdo é o produto. A ficha técnica de um fabricante não é monetizada por pageviews. É material de marketing de uma coisa física que você vende com margem. Se um assistente ler o seu catálogo inteiro 70.000 vezes e enviar um engenheiro que especifica a sua peça em um programa de 500.000 unidades, você ganhou. A queixa dos publishers sobre o crawl-to-refer, importada sem exame para o contexto industrial, produz exatamente a política errada.

O que os pedágios de fato fazem

MecanismoO que éSituaçãoRelevância para um fabricante
Categorização por finalidadeA Cloudflare divide o tráfego de IA em Search, Agent e Training, cada um controlável separadamenteEm vigor; novos padrões a partir de 15 de setembro de 2026Alta — você deveria definir a sua própria política por categoria em vez de herdar uma
Bloqueio padrão em páginas com anúnciosRastreadores Training e Agent bloqueados por padrão em páginas com publicidade; rastreadores de uso misto bloqueados por completo nelasA partir de 15 de setembro de 2026, para clientes novos, sites novos e sites existentes do plano gratuitoIndireta — é improvável que o seu catálogo veicule anúncios, mas a imprensa setorial que discute as suas peças veicula
Pay-per-crawlRespostas HTTP 402 informando um preço, com os cabeçalhos crawler-max-price, crawler-exact-price e crawler-charged, liquidadas na bordaBeta privadoBaixa hoje; um sinal de para onde a tarifação está indo
Web Bot Auth / agentes assinadosIdentidade criptográfica do agente via HTTP Message Signatures e um cabeçalho Signature-Agent, substituindo as strings de user-agentLançado pela Cloudflare em agosto de 2025; avançando no IETFAlta — é a pré-condição para servir dados com direito de acesso a um agente conhecido

A última linha é a que importa comercialmente, e é a que ninguém no suprimento industrial está discutindo.

Tudo aquilo com que um fornecedor industrial realmente vende — preço de contrato, estoque alocado, prazos de entrega específicos por cliente, listas de alternativos aprovados — são dados que você não pode publicar abertamente. Hoje isso significa que os agentes recebem o preço de tabela público e uma frase genérica de disponibilidade, ou seja, recebem algo errado. A identidade verificável do agente é o que transforma "não podemos expor isso" em "podemos expor isso para este agente, agindo por este cliente, e registrar o acesso". Isso não é uma história de bloqueio de rastreadores. É uma história de habilitação de canal que por acaso roda no mesmo encanamento.

A lição do llms.txt

Vale a pena se deter no llms.txt, porque ele é a ilustração perfeita de como esse mercado aloca mal o esforço.

A proposta era razoável: um arquivo de texto simples informando aos sistemas de IA onde está o seu bom conteúdo. Foi amplamente adotada. Foi comentada em toda newsletter de marketing. A Ahrefs então analisou 137.210 domínios e descobriu que 97% dos arquivos llms.txt publicados receberam zero requisições em maio de 2026. A maior parte das buscas que de fato ocorreram vinha de ferramentas de auditoria de SEO, e não de sistemas de IA, e o estudo não encontrou nenhuma evidência de ganho de citações no ChatGPT, no Perplexity ou nas AI Overviews.

Enquanto isso, o mesmo conjunto de dados mostrou que os bots de IA representavam 19,5% de todas as requisições, com a infraestrutura agêntica como a maior categoria de IA, com 10,5%. As máquinas estavam absolutamente ali. Elas só estavam buscando as suas páginas de verdade — aquelas que muitos fabricantes renderizam no cliente e, portanto, entregam vazias.

A lição se generaliza para além de um arquivo. A adoção de uma convenção não é o mesmo que o consumo dela. O teste confiável não é se um padrão tem tração no debate; é se clientes reais o buscam. Duas coisas passam nesse teste hoje: HTML renderizado no servidor e endpoints de Model Context Protocol — tendo o MCP alcançado cerca de 97 milhões de downloads mensais de SDK até março de 2026 e migrado para uma governança neutra sob a Agentic AI Foundation da Linux Foundation em dezembro de 2025, com AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft e OpenAI como membros platinum.

A corrente regulatória segue na mesma direção

Há uma segunda força empurrando os dados industriais para o formato legível por máquina, e ela nada tem a ver com IA.

O Regulamento de Execução (UE) 2026/1778 da Comissão, adotado em 16 de julho de 2026, estabeleceu as regras operacionais do registro do Passaporte Digital de Produto criado pelo Regulamento de Ecodesign para Produtos Sustentáveis — estrutura, verificação de identidade, registro, comprovação de registro, log e retenção. A Comissão lançou o registro poucos dias depois. Os produtos de construção seguem por uma trilha separada, sob o Regulamento de Produtos de Construção revisto, em um cronograma mais longo.

Retire a linguagem de conformidade e a exigência é: dados de produto estruturados e legíveis por máquina, com identidade e procedência verificadas, recuperáveis por um terceiro. Isso é quase exatamente a descrição de um catálogo pronto para agentes. Qualquer fabricante que trate a conformidade com o DPP e a legibilidade por IA como dois programas sem relação, com dois orçamentos, está construindo o mesmo ativo duas vezes.

O que um fabricante deveria realmente fazer

  1. 01Teste o que uma máquina enxerga. Busque as suas próprias páginas de catálogo com um cliente comum, sem navegador. Quando a Partsgraph auditou 984 domínios de distribuidores e fabricantes no mundo todo em agosto de 2026, 38% não devolveram nenhuma página de catálogo legível a um cliente padrão sem navegador, e a mediana da pontuação de visibilidade para IA foi 50 em 100. A renderização no cliente é a culpada de sempre e é invisível em qualquer painel normal de analytics.
  2. 02Escreva uma política explícita de rastreadores e publique-a. Decida, por categoria, o que você permite: indexação de busca, recuperação para respostas, acesso de agentes, treinamento. Na mesma auditoria, apenas 19% dos 984 domínios publicavam uma política explícita para rastreadores de IA nomeando os principais bots — o que significa que quatro em cada cinco estão operando com o padrão que o fornecedor de CDN escolher por eles e, à medida que os padrões da borda se apertam, o silêncio se resolve como "não".
  3. 03Confira os padrões da sua CDN antes de 15 de setembro de 2026. Se você está em um plano gratuito ou subindo novas propriedades, os padrões mudam por baixo de você. É uma tarefa de dez minutos que ninguém colocou na agenda.
  4. 04Não bloqueie indiscriminadamente. Copiar a postura de bloqueio de um publisher otimiza para uma receita que você não obtém e abre mão de uma distribuição de que você precisa.
  5. 05Sirva estaticamente o dado durável e ao vivo o dado volátil. Paramétricos, situação de conformidade e ciclo de vida podem ser renderizados no servidor e estruturados. Estoque, prazo de entrega e preço de contrato não podem ser rastreados corretamente em nenhuma frequência de atualização e pertencem a um endpoint consultável.
  6. 06Prepare-se para a identidade, não só para o acesso. Os agentes assinados vão tornar possíveis respostas sensíveis a direitos de acesso. Os fornecedores que já normalizaram seus dados de preço e disponibilidade conseguirão aproveitar isso; os que não normalizaram gastarão essa janela fazendo limpeza de dados.
  7. 07Monitore a acurácia, não só a visibilidade. Um prazo de entrega errado dito com confiança causa mais dano comercial do que um prazo ausente, e nenhum dos dois aparece em um relatório de rankings.

Por que ser o primeiro importa mais aqui do que de costume

Há um motivo específico para agir cedo, e não é o argumento habitual da corrida por território.

Os assistentes convergem. Quando um modelo encontra uma fonte que responde de forma correta e barata a uma classe de perguntas — uma que é interpretada sem ambiguidade, resolve números de peça de modo consistente e não se contradiz entre páginas —, essa fonte se torna o caminho de menor resistência para a classe inteira. Ela passa a ser recuperada mais, citada mais e reforçada na rodada seguinte de treinamento e nos índices de recuperação construídos em cima dela.

Isso não é uma posição de ranking que você possa recomprar depois com um orçamento maior, porque o mecanismo não é um leilão. É um padrão. E os padrões industriais são excepcionalmente persistentes, porque se sedimentam em documentos que perduram: uma lista de fornecedores aprovados, uma especificação padrão, uma lista de materiais modelo. Uma peça que se torna a resposta padrão em 2026 continua no modelo em 2031.

O corolário é desconfortável para quem está esperando o cenário clarear. O custo de chegar cedo é um projeto de dados. O custo de chegar tarde não é um projeto de dados feito depois — é um projeto de dados feito depois contra um concorrente que já é a resposta padrão.

O avaliador gratuito em [/audit](/audit) mostra exatamente o que uma máquina lê do seu catálogo hoje, e onde estão as lacunas.

Perguntas frequentes

O que muda em 15 de setembro de 2026?

A Cloudflare passa a categorizar o tráfego de rastreadores de IA como Search, Agent ou Training, em vez de tratá-lo como uma classe única. A partir dessa data, os rastreadores Training e Agent ficam bloqueados por padrão em páginas que exibem publicidade, e os rastreadores de uso misto que não declararem sua finalidade a cada requisição ficam bloqueados por completo nessas páginas. Os padrões valem para clientes novos, para sites novos criados por clientes existentes e para todos os sites existentes do plano gratuito; clientes pagantes podem sobrescrevê-los antes disso nas configurações de segurança.

Isso afeta o catálogo de produtos de um fabricante?

Em geral não diretamente, porque os padrões se baseiam em páginas com anúncios e a maioria dos catálogos de fabricantes não veicula publicidade. A questão importa por dois motivos indiretos. Primeiro, as publicações setoriais, o conteúdo de distribuidores e os fóruns técnicos em que as suas peças são discutidas costumam ser sustentados por anúncios, de modo que a cobertura de terceiros sobre os seus produtos pode ficar menos disponível para os assistentes. Segundo, isso estabelece o precedente de que o acesso de rastreadores é uma permissão tarifada e concedida por finalidade — e esse modelo vai se espalhar.

O que é o crawl-to-refer e por que isso importa?

É o número de páginas que uma empresa de IA rastreia para cada visitante que ela devolve. A Cloudflare começou a publicar essas razões no Radar em 2025, com o rastreador da Anthropic em cerca de 70.900 páginas rastreadas por referência em uma amostra do fim de junho de 2025, contra a norma da busca tradicional de umas poucas raspagens ou menos por visitante enviado. Essa razão é o motivo pelo qual os publishers começaram a bloquear. Para um fabricante, a inversão é importante: você não vende publicidade em cima de tráfego, então um crawl-to-refer alto não é um custo para você — é distribuição pela qual você não está pagando.

Devo publicar um arquivo llms.txt?

Custa quase nada e faz quase nada. A Ahrefs analisou 137.210 domínios e constatou que 97% dos arquivos llms.txt publicados receberam zero requisições em maio de 2026, sendo que a maior parte das buscas que de fato ocorreram vinha de ferramentas de SEO, e não de sistemas de IA, sem nenhum ganho mensurável de citações. Publique um se for de graça; nunca deixe que ele substitua páginas renderizadas no servidor, dados estruturados, feeds ou um endpoint.

O que é o Web Bot Auth e por que um fabricante deveria se importar?

É uma forma de um cliente automatizado provar criptograficamente a sua identidade usando HTTP Message Signatures, uma chave Ed25519 por agente e um cabeçalho Signature-Agent, em vez de depender de uma string de user-agent fácil de falsificar. A Cloudflare lançou os agentes assinados em agosto de 2025 com um grupo inicial que incluía o ChatGPT agent e o Goose, da Block, e o trabalho agora avança no IETF. Importa porque é a pré-condição para servir dados diferentes a agentes diferentes — e é assim que o preço de contrato e a disponibilidade específica por cliente acabarão chegando aos agentes com segurança.

Bloquear rastreadores de IA é um padrão sensato para um fornecedor industrial?

Quase nunca. Bloquear faz sentido quando o seu conteúdo é o produto e o tráfego é a receita — mídia, publicações, pesquisa. Para um fabricante ou distribuidor, o catálogo é material de marketing de um produto físico, e estar ausente da resposta de um assistente custa uma especificação. A postura correta é seletiva: abra o catálogo, publique uma política explícita de rastreadores e tarife ou autentique aquilo que é de fato sensível do ponto de vista comercial, como o preço de contrato.

Como a regulação da UE interage com isso?

Ela empurra na mesma direção, por outro motivo. O Regulamento de Execução (UE) 2026/1778 da Comissão, de 16 de julho de 2026, definiu as regras operacionais do registro do Passaporte Digital de Produto da UE sob o ESPR, que a Comissão lançou poucos dias depois. Os produtos de construção estão sendo tratados à parte, sob o Regulamento de Produtos de Construção revisto, em um cronograma posterior. A exigência de conformidade é ter dados de produto estruturados e legíveis por máquina, com identidade e procedência verificadas — que é substancialmente o mesmo ativo exigido pela web agêntica. Os fabricantes que o construírem duas vezes, uma para Bruxelas e outra para os assistentes, estão desperdiçando o orçamento.

Fontes

  1. 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
  2. 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
  3. 03Cloudflare, Introducing pay per crawl
  4. 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
  5. 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
  6. 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
  7. 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
  8. 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
  9. 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
  10. 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
  11. 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
Teste no seu próprio catálogo

Veja exatamente o que os assistentes de IA conseguem e o que não conseguem ler dos seus produtos hoje — política de rastreamento, cobertura do catálogo, acesso às fichas técnicas —, com pontuação e comparação com 984 distribuidores e fabricantes do mundo todo.

Avaliar meu catálogo

Notas de campo relacionadas