# A web agêntica e os dados de produto industriais

> A web se divide em uma superfície humana e outra de máquina. Economia do crawl-to-refer, os pedágios da Cloudflare, agentes assinados e o que fazer.

**Language:** pt  
**Published:** 2026-08-09  
**Category:** Market · **Tags:** agentic web, crawlers, Cloudflare, Web Bot Auth, llms.txt, product data  
**Canonical:** https://partsgraph.ai/pt/blog/the-agentic-web-and-industrial-data

## Em resumo

**Como a web agêntica está mudando o que os fabricantes industriais precisam publicar?**

A web está se separando em uma superfície humana, otimizada para navegadores, e uma superfície de máquina, otimizada para agentes — e as duas passaram a ser governadas de formas diferentes. O tráfego automatizado já supera o humano: a Imperva mediu 53% do tráfego da web como automatizado em 2025. E os provedores de infraestrutura agora o tarifam: a partir de 15 de setembro de 2026, a Cloudflare bloqueia por padrão os rastreadores de treinamento de IA e de agentes em páginas com publicidade, para sites novos e do plano gratuito, tendo o pay-per-crawl e a identidade de agente assinada criptograficamente como as alternativas emergentes ao bloqueio geral. Para um fabricante, a consequência prática é que ser rastreável já não é o mesmo que ser alcançável — e as empresas que se tornarem precisas e alcançáveis primeiro passam a ser a resposta padrão.

---

## A web agora tem dois públicos, e só um deles tem olhos

Durante trinta anos, publicar na web significou publicar para uma pessoa com um mouse na mão. Tudo o que vinha depois — layout, frameworks JavaScript, banners de cookies, analytics, inventário de anúncios — pressupunha um ser humano do outro lado.

> **Figure.** How a canonical parts graph sits between existing systems and agent-facing surfaces.

Essa premissa hoje é falsa com mais frequência do que é verdadeira. O Bad Bot Report 2026 da Imperva constatou que o tráfego automatizado respondeu por 53% de todo o tráfego da web em 2025, ante 51%, com o tráfego humano caindo para 47% e ainda em queda. A Cloudflare fez a mesma observação ao anunciar sua política de rastreadores para 2026: a maior parte do tráfego da internet não é humana.

A consequência interessante não é a proporção. É que os dois públicos agora são *governados separadamente* — regras de acesso diferentes, precificação diferente, exigências de identidade diferentes. A web está se bifurcando em uma superfície humana e uma superfície de máquina, e os fabricantes industriais não dedicaram tempo algum a pensar na segunda.

## Por que a economia se quebrou?

A busca funcionava porque era uma troca. Um rastreador levava a sua página e devolvia visitantes. Os publishers aceitavam o acordo porque a taxa de câmbio era favorável.

A recuperação por IA quebrou essa taxa de câmbio. Em 2025, a Cloudflare começou a publicar no Radar as razões de crawl-to-refer — páginas rastreadas por referência enviada — e os números não chegavam perto da norma da busca, de umas poucas raspagens ou menos por visitante. Em uma amostra do fim de junho de 2025, o rastreador da Anthropic estava em cerca de 70.900 páginas rastreadas por referência. A Cloudflare também informou, em 2026, que mais da metade do tráfego de rastreio de IA é gasta rebuscando páginas que não mudaram.

Enquanto isso, o lado humano da troca definhou por conta própria. A SparkToro mediu que 68% das buscas do Google nos EUA terminaram sem clique no início de 2026, com cerca de 276 cliques por 1.000 buscas chegando à web aberta, ante 374 em 2024.

Assim, os publishers enfrentaram extração crescente e remuneração decrescente, e fizeram o previsível.

**Mas repare bem que essa lógica é específica de negócios cujo conteúdo é o produto.** A ficha técnica de um fabricante não é monetizada por pageviews. É material de marketing de uma coisa física que você vende com margem. Se um assistente ler o seu catálogo inteiro 70.000 vezes e enviar um engenheiro que especifica a sua peça em um programa de 500.000 unidades, você ganhou. A queixa dos publishers sobre o crawl-to-refer, importada sem exame para o contexto industrial, produz exatamente a política errada.

## O que os pedágios de fato fazem

| Mecanismo | O que é | Situação | Relevância para um fabricante |
| --- | --- | --- | --- |
| Categorização por finalidade | A Cloudflare divide o tráfego de IA em Search, Agent e Training, cada um controlável separadamente | Em vigor; novos padrões a partir de 15 de setembro de 2026 | Alta — você deveria definir a sua própria política por categoria em vez de herdar uma |
| Bloqueio padrão em páginas com anúncios | Rastreadores Training e Agent bloqueados por padrão em páginas com publicidade; rastreadores de uso misto bloqueados por completo nelas | A partir de 15 de setembro de 2026, para clientes novos, sites novos e sites existentes do plano gratuito | Indireta — é improvável que o seu catálogo veicule anúncios, mas a imprensa setorial que discute as suas peças veicula |
| Pay-per-crawl | Respostas HTTP 402 informando um preço, com os cabeçalhos `crawler-max-price`, `crawler-exact-price` e `crawler-charged`, liquidadas na borda | Beta privado | Baixa hoje; um sinal de para onde a tarifação está indo |
| Web Bot Auth / agentes assinados | Identidade criptográfica do agente via HTTP Message Signatures e um cabeçalho `Signature-Agent`, substituindo as strings de user-agent | Lançado pela Cloudflare em agosto de 2025; avançando no IETF | **Alta** — é a pré-condição para servir dados com direito de acesso a um agente conhecido |

A última linha é a que importa comercialmente, e é a que ninguém no suprimento industrial está discutindo.

Tudo aquilo com que um fornecedor industrial realmente vende — preço de contrato, estoque alocado, prazos de entrega específicos por cliente, listas de alternativos aprovados — são dados que você não pode publicar abertamente. Hoje isso significa que os agentes recebem o preço de tabela público e uma frase genérica de disponibilidade, ou seja, recebem algo errado. A identidade verificável do agente é o que transforma "não podemos expor isso" em "podemos expor isso para *este* agente, agindo por *este* cliente, e registrar o acesso". Isso não é uma história de bloqueio de rastreadores. É uma história de habilitação de canal que por acaso roda no mesmo encanamento.

## A lição do llms.txt

Vale a pena se deter no llms.txt, porque ele é a ilustração perfeita de como esse mercado aloca mal o esforço.

A proposta era razoável: um arquivo de texto simples informando aos sistemas de IA onde está o seu bom conteúdo. Foi amplamente adotada. Foi comentada em toda newsletter de marketing. A Ahrefs então analisou 137.210 domínios e descobriu que **97% dos arquivos llms.txt publicados receberam zero requisições em maio de 2026**. A maior parte das buscas que de fato ocorreram vinha de ferramentas de auditoria de SEO, e não de sistemas de IA, e o estudo não encontrou nenhuma evidência de ganho de citações no ChatGPT, no Perplexity ou nas AI Overviews.

Enquanto isso, o mesmo conjunto de dados mostrou que os bots de IA representavam 19,5% de todas as requisições, com a infraestrutura agêntica como a maior categoria de IA, com 10,5%. As máquinas estavam absolutamente ali. Elas só estavam buscando as suas páginas de verdade — aquelas que muitos fabricantes renderizam no cliente e, portanto, entregam vazias.

A lição se generaliza para além de um arquivo. **A adoção de uma convenção não é o mesmo que o consumo dela.** O teste confiável não é se um padrão tem tração no debate; é se clientes reais o buscam. Duas coisas passam nesse teste hoje: HTML renderizado no servidor e endpoints de Model Context Protocol — tendo o MCP alcançado cerca de 97 milhões de downloads mensais de SDK até março de 2026 e migrado para uma governança neutra sob a Agentic AI Foundation da Linux Foundation em dezembro de 2025, com AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft e OpenAI como membros platinum.

## A corrente regulatória segue na mesma direção

Há uma segunda força empurrando os dados industriais para o formato legível por máquina, e ela nada tem a ver com IA.

O Regulamento de Execução (UE) 2026/1778 da Comissão, adotado em 16 de julho de 2026, estabeleceu as regras operacionais do registro do Passaporte Digital de Produto criado pelo Regulamento de Ecodesign para Produtos Sustentáveis — estrutura, verificação de identidade, registro, comprovação de registro, log e retenção. A Comissão lançou o registro poucos dias depois. Os produtos de construção seguem por uma trilha separada, sob o Regulamento de Produtos de Construção revisto, em um cronograma mais longo.

Retire a linguagem de conformidade e a exigência é: dados de produto estruturados e legíveis por máquina, com identidade e procedência verificadas, recuperáveis por um terceiro. Isso é quase exatamente a descrição de um catálogo pronto para agentes. Qualquer fabricante que trate a conformidade com o DPP e a legibilidade por IA como dois programas sem relação, com dois orçamentos, está construindo o mesmo ativo duas vezes.

## O que um fabricante deveria realmente fazer

1. **Teste o que uma máquina enxerga.** Busque as suas próprias páginas de catálogo com um cliente comum, sem navegador. Quando a Partsgraph auditou 984 domínios de distribuidores e fabricantes no mundo todo em agosto de 2026, 38% não devolveram nenhuma página de catálogo legível a um cliente padrão sem navegador, e a mediana da pontuação de visibilidade para IA foi 50 em 100. A renderização no cliente é a culpada de sempre e é invisível em qualquer painel normal de analytics.
2. **Escreva uma política explícita de rastreadores e publique-a.** Decida, por categoria, o que você permite: indexação de busca, recuperação para respostas, acesso de agentes, treinamento. Na mesma auditoria, apenas 19% dos 984 domínios publicavam uma política explícita para rastreadores de IA nomeando os principais bots — o que significa que quatro em cada cinco estão operando com o padrão que o fornecedor de CDN escolher por eles e, à medida que os padrões da borda se apertam, o silêncio se resolve como "não".
3. **Confira os padrões da sua CDN antes de 15 de setembro de 2026.** Se você está em um plano gratuito ou subindo novas propriedades, os padrões mudam por baixo de você. É uma tarefa de dez minutos que ninguém colocou na agenda.
4. **Não bloqueie indiscriminadamente.** Copiar a postura de bloqueio de um publisher otimiza para uma receita que você não obtém e abre mão de uma distribuição de que você precisa.
5. **Sirva estaticamente o dado durável e ao vivo o dado volátil.** Paramétricos, situação de conformidade e ciclo de vida podem ser renderizados no servidor e estruturados. Estoque, prazo de entrega e preço de contrato não podem ser rastreados corretamente em nenhuma frequência de atualização e pertencem a um endpoint consultável.
6. **Prepare-se para a identidade, não só para o acesso.** Os agentes assinados vão tornar possíveis respostas sensíveis a direitos de acesso. Os fornecedores que já normalizaram seus dados de preço e disponibilidade conseguirão aproveitar isso; os que não normalizaram gastarão essa janela fazendo limpeza de dados.
7. **Monitore a acurácia, não só a visibilidade.** Um prazo de entrega errado dito com confiança causa mais dano comercial do que um prazo ausente, e nenhum dos dois aparece em um relatório de rankings.

## Por que ser o primeiro importa mais aqui do que de costume

Há um motivo específico para agir cedo, e não é o argumento habitual da corrida por território.

Os assistentes convergem. Quando um modelo encontra uma fonte que responde de forma correta e barata a uma classe de perguntas — uma que é interpretada sem ambiguidade, resolve números de peça de modo consistente e não se contradiz entre páginas —, essa fonte se torna o caminho de menor resistência para a classe inteira. Ela passa a ser recuperada mais, citada mais e reforçada na rodada seguinte de treinamento e nos índices de recuperação construídos em cima dela.

Isso não é uma posição de ranking que você possa recomprar depois com um orçamento maior, porque o mecanismo não é um leilão. É um padrão. E os padrões industriais são excepcionalmente persistentes, porque se sedimentam em documentos que perduram: uma lista de fornecedores aprovados, uma especificação padrão, uma lista de materiais modelo. Uma peça que se torna a resposta padrão em 2026 continua no modelo em 2031.

O corolário é desconfortável para quem está esperando o cenário clarear. O custo de chegar cedo é um projeto de dados. O custo de chegar tarde não é um projeto de dados feito depois — é um projeto de dados feito depois contra um concorrente que já é a resposta padrão.

*O avaliador gratuito em [/audit](/audit) mostra exatamente o que uma máquina lê do seu catálogo hoje, e onde estão as lacunas.*

## Perguntas frequentes

### O que muda em 15 de setembro de 2026?

A Cloudflare passa a categorizar o tráfego de rastreadores de IA como Search, Agent ou Training, em vez de tratá-lo como uma classe única. A partir dessa data, os rastreadores Training e Agent ficam bloqueados por padrão em páginas que exibem publicidade, e os rastreadores de uso misto que não declararem sua finalidade a cada requisição ficam bloqueados por completo nessas páginas. Os padrões valem para clientes novos, para sites novos criados por clientes existentes e para todos os sites existentes do plano gratuito; clientes pagantes podem sobrescrevê-los antes disso nas configurações de segurança.

### Isso afeta o catálogo de produtos de um fabricante?

Em geral não diretamente, porque os padrões se baseiam em páginas com anúncios e a maioria dos catálogos de fabricantes não veicula publicidade. A questão importa por dois motivos indiretos. Primeiro, as publicações setoriais, o conteúdo de distribuidores e os fóruns técnicos em que as suas peças são discutidas costumam ser sustentados por anúncios, de modo que a cobertura de terceiros sobre os seus produtos pode ficar menos disponível para os assistentes. Segundo, isso estabelece o precedente de que o acesso de rastreadores é uma permissão tarifada e concedida por finalidade — e esse modelo vai se espalhar.

### O que é o crawl-to-refer e por que isso importa?

É o número de páginas que uma empresa de IA rastreia para cada visitante que ela devolve. A Cloudflare começou a publicar essas razões no Radar em 2025, com o rastreador da Anthropic em cerca de 70.900 páginas rastreadas por referência em uma amostra do fim de junho de 2025, contra a norma da busca tradicional de umas poucas raspagens ou menos por visitante enviado. Essa razão é o motivo pelo qual os publishers começaram a bloquear. Para um fabricante, a inversão é importante: você não vende publicidade em cima de tráfego, então um crawl-to-refer alto não é um custo para você — é distribuição pela qual você não está pagando.

### Devo publicar um arquivo llms.txt?

Custa quase nada e faz quase nada. A Ahrefs analisou 137.210 domínios e constatou que 97% dos arquivos llms.txt publicados receberam zero requisições em maio de 2026, sendo que a maior parte das buscas que de fato ocorreram vinha de ferramentas de SEO, e não de sistemas de IA, sem nenhum ganho mensurável de citações. Publique um se for de graça; nunca deixe que ele substitua páginas renderizadas no servidor, dados estruturados, feeds ou um endpoint.

### O que é o Web Bot Auth e por que um fabricante deveria se importar?

É uma forma de um cliente automatizado provar criptograficamente a sua identidade usando HTTP Message Signatures, uma chave Ed25519 por agente e um cabeçalho Signature-Agent, em vez de depender de uma string de user-agent fácil de falsificar. A Cloudflare lançou os agentes assinados em agosto de 2025 com um grupo inicial que incluía o ChatGPT agent e o Goose, da Block, e o trabalho agora avança no IETF. Importa porque é a pré-condição para servir dados diferentes a agentes diferentes — e é assim que o preço de contrato e a disponibilidade específica por cliente acabarão chegando aos agentes com segurança.

### Bloquear rastreadores de IA é um padrão sensato para um fornecedor industrial?

Quase nunca. Bloquear faz sentido quando o seu conteúdo é o produto e o tráfego é a receita — mídia, publicações, pesquisa. Para um fabricante ou distribuidor, o catálogo é material de marketing de um produto físico, e estar ausente da resposta de um assistente custa uma especificação. A postura correta é seletiva: abra o catálogo, publique uma política explícita de rastreadores e tarife ou autentique aquilo que é de fato sensível do ponto de vista comercial, como o preço de contrato.

### Como a regulação da UE interage com isso?

Ela empurra na mesma direção, por outro motivo. O Regulamento de Execução (UE) 2026/1778 da Comissão, de 16 de julho de 2026, definiu as regras operacionais do registro do Passaporte Digital de Produto da UE sob o ESPR, que a Comissão lançou poucos dias depois. Os produtos de construção estão sendo tratados à parte, sob o Regulamento de Produtos de Construção revisto, em um cronograma posterior. A exigência de conformidade é ter dados de produto estruturados e legíveis por máquina, com identidade e procedência verificadas — que é substancialmente o mesmo ativo exigido pela web agêntica. Os fabricantes que o construírem duas vezes, uma para Bruxelas e outra para os assistentes, estão desperdiçando o orçamento.

## Fontes

1. [TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/)
2. [Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)](https://www.helpnetsecurity.com/2026/07/02/cloudflare-ai-crawler-controls/)
3. [Cloudflare, Introducing pay per crawl](https://blog.cloudflare.com/introducing-pay-per-crawl/)
4. [Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
5. [Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)](https://blog.cloudflare.com/signed-agents/)
6. [IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)](https://datatracker.ietf.org/doc/html/draft-meunier-web-bot-auth-architecture)
7. [Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)](https://ahrefs.com/blog/llmstxt-study/)
8. [Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)
9. [SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click](https://sparktoro.com/blog/in-2026-less-than-one-third-of-google-searches-still-send-a-click/)
10. [Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)](https://blog.modelcontextprotocol.io/posts/2025-12-09-mcp-joins-agentic-ai-foundation/)
11. [EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)](https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=OJ%3AL_202601778)

## Other languages

- English: https://partsgraph.ai/blog/the-agentic-web-and-industrial-data/md
- Deutsch: https://partsgraph.ai/de/blog/the-agentic-web-and-industrial-data/md
- Français: https://partsgraph.ai/fr/blog/the-agentic-web-and-industrial-data/md
- Español: https://partsgraph.ai/es/blog/the-agentic-web-and-industrial-data/md
- Italiano: https://partsgraph.ai/it/blog/the-agentic-web-and-industrial-data/md
- Nederlands: https://partsgraph.ai/nl/blog/the-agentic-web-and-industrial-data/md
- Polski: https://partsgraph.ai/pl/blog/the-agentic-web-and-industrial-data/md
- Svenska: https://partsgraph.ai/sv/blog/the-agentic-web-and-industrial-data/md
- Türkçe: https://partsgraph.ai/tr/blog/the-agentic-web-and-industrial-data/md
- 日本語: https://partsgraph.ai/ja/blog/the-agentic-web-and-industrial-data/md
- 한국어: https://partsgraph.ai/ko/blog/the-agentic-web-and-industrial-data/md
- 简体中文: https://partsgraph.ai/zh/blog/the-agentic-web-and-industrial-data/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/pt/audit
