Le web agentique et les données produits industrielles

Publié le 2026-08-0911 min de lectureagentic web · crawlers · Cloudflare · Web Bot Auth

En bref

En quoi le web agentique change-t-il ce que les fabricants industriels doivent publier ?

Le web se sépare en une surface humaine, optimisée pour les navigateurs, et une surface machine, optimisée pour les agents, et les deux sont désormais gouvernées différemment. Le trafic automatisé dépasse déjà le trafic humain — Imperva a mesuré 53 % de trafic web automatisé en 2025 — et les fournisseurs d'infrastructure se mettent à le facturer : à partir du 15 septembre 2026, Cloudflare bloque par défaut les crawlers d'entraînement et d'agents IA sur les pages porteuses de publicité, pour les nouveaux sites et ceux de la formule gratuite, le pay-per-crawl et l'identité d'agent signée cryptographiquement s'imposant comme les alternatives émergentes au blocage généralisé. Pour un fabricant, la conséquence pratique est qu'être crawlable ne revient plus à être atteignable : les entreprises qui deviennent exactes et atteignables les premières deviennent la réponse par défaut.

Le web a désormais deux publics, et un seul a des yeux

Pendant trente ans, publier sur le web a voulu dire publier pour une personne tenant une souris. Tout ce qui en découlait — la mise en page, les frameworks JavaScript, les bandeaux cookies, l'analytique, l'inventaire publicitaire — supposait un humain à l'autre bout.

Nothing in the top row changes. The layer reads from what already exists and publishes it in the shapes agents actually request.

Cette hypothèse est désormais fausse plus souvent qu'elle n'est vraie. Le Bad Bot Report 2026 d'Imperva a établi que le trafic automatisé représentait 53 % de l'ensemble du trafic web en 2025, contre 51 % auparavant, le trafic humain retombant à 47 % et continuant de baisser. Cloudflare a fait le même constat en annonçant sa politique 2026 à l'égard des crawlers : la majorité du trafic internet n'est pas humaine.

La conséquence intéressante n'est pas le ratio. C'est que les deux publics sont désormais gouvernés séparément — règles d'accès différentes, tarification différente, exigences d'identité différentes. Le web se scinde en une surface humaine et une surface machine, et les fabricants industriels n'ont pas consacré la moindre réflexion à la seconde.

Pourquoi l'équilibre économique a-t-il cédé ?

La recherche fonctionnait parce que c'était un échange. Un crawler prenait votre page et vous renvoyait des visiteurs. Les éditeurs acceptaient le marché parce que le taux de change leur était favorable.

La recherche par IA a cassé ce taux de change. Cloudflare a commencé à publier sur Radar, en 2025, les ratios crawl-to-refer — pages crawlées par visite référée — et les chiffres n'avaient rien à voir avec la norme de la recherche, de l'ordre de deux crawls ou moins par visiteur. Sur un échantillon de fin juin 2025, le crawler d'Anthropic s'établissait à environ 70 900 pages crawlées par visite référée. Cloudflare a par ailleurs rapporté en 2026 que plus de la moitié du trafic de crawl IA sert à re-télécharger des pages qui n'ont pas changé.

Pendant ce temps, le versant humain de l'échange s'est étiolé de son côté. SparkToro a mesuré que 68 % des recherches Google aux États-Unis se terminaient sans clic début 2026, avec environ 276 clics pour 1 000 recherches atteignant le web ouvert, contre 374 en 2024.

Les éditeurs ont donc vu l'extraction augmenter et la rémunération baisser, et ils ont fait ce qui était prévisible.

Mais notez bien que cette logique vaut pour les entreprises dont le contenu est le produit. La fiche technique d'un fabricant n'est pas monétisée à la page vue. C'est un support marketing au service d'un objet physique que vous vendez avec une marge. Si un assistant lit l'intégralité de votre catalogue 70 000 fois et vous envoie un seul ingénieur qui inscrit votre pièce dans un programme de 500 000 unités, vous avez gagné. La plainte des éditeurs sur le crawl-to-refer, importée sans examen dans un contexte industriel, produit exactement la mauvaise politique.

Ce que font réellement les péages

MécanismeDe quoi il s'agitStatutPertinence pour un fabricant
Catégorisation par finalitéCloudflare répartit le trafic IA en Search, Agent et Training, chacun contrôlable séparémentEn production ; nouveaux réglages par défaut à partir du 15 septembre 2026Élevée — c'est à vous de décider votre politique par catégorie plutôt que d'en hériter une
Blocage par défaut sur les pages publicitairesCrawlers Training et Agent bloqués par défaut sur les pages porteuses de publicité ; crawlers à usage mixte bloqués intégralement sur celles-ciÀ partir du 15 septembre 2026, pour les nouveaux clients, les nouveaux sites et les sites existants de la formule gratuiteIndirecte — votre catalogue n'affiche sans doute pas de publicité, mais la presse professionnelle qui parle de vos pièces, si
Pay-per-crawlRéponses HTTP 402 indiquant un prix, avec les en-têtes crawler-max-price, crawler-exact-price et crawler-charged, réglées à la périphérieBêta privéeFaible aujourd'hui ; un signal de la direction que prend la facturation
Web Bot Auth / agents signésIdentité d'agent cryptographique via HTTP Message Signatures et un en-tête Signature-Agent, en remplacement des chaînes user-agentLivré par Cloudflare en août 2025 ; en cours de normalisation à l'IETFÉlevée — c'est la condition préalable pour servir des données sous droits à un agent connu

La dernière ligne est celle qui compte commercialement, et c'est celle dont personne, dans l'approvisionnement industriel, ne parle.

Tout ce qui fait réellement vendre un fournisseur industriel — prix contractuels, stock alloué, délais propres à chaque client, listes d'équivalences approuvées — relève de données que vous ne pouvez pas publier ouvertement. Aujourd'hui, cela signifie que les agents obtiennent le prix public catalogue et une mention de disponibilité générique, autrement dit quelque chose de faux. L'identité d'agent vérifiable est ce qui transforme « nous ne pouvons pas exposer cela » en « nous pouvons l'exposer à cet agent-là, agissant pour ce client-là, et le journaliser ». Ce n'est pas une histoire de blocage de crawlers. C'est une histoire d'ouverture de canal commercial, qui se trouve emprunter la même tuyauterie.

La leçon llms.txt

Il vaut la peine de s'attarder sur llms.txt, car c'est l'illustration parfaite de la façon dont ce marché répartit mal ses efforts.

La proposition était raisonnable : un fichier en texte brut indiquant aux systèmes d'IA où se trouve votre bon contenu. Elle a été largement adoptée. Elle a été relayée par toutes les newsletters marketing. Ahrefs a ensuite analysé 137 210 domaines et constaté que 97 % des fichiers llms.txt publiés n'avaient reçu aucune requête en mai 2026. La plupart des récupérations effectivement observées provenaient d'outils d'audit SEO plutôt que de systèmes d'IA, et l'étude n'a trouvé aucune preuve d'un quelconque gain de citations dans ChatGPT, Perplexity ou les AI Overviews.

Pendant ce temps, le même jeu de données montrait que les bots IA représentaient 19,5 % de l'ensemble des requêtes, l'infrastructure agentique constituant la première catégorie d'IA avec 10,5 %. Les machines étaient bel et bien là. Elles récupéraient simplement vos vraies pages — celles que beaucoup de fabricants font rendre côté client et servent donc vides.

La leçon dépasse le cas d'un seul fichier. L'adoption d'une convention n'équivaut pas à sa consommation. Le test fiable n'est pas de savoir si un standard a le vent en poupe dans les discussions ; c'est de savoir si de vrais clients vont le chercher. Deux choses passent aujourd'hui ce test : le HTML rendu côté serveur et les points d'accès Model Context Protocol — MCP a atteint environ 97 millions de téléchargements mensuels de SDK en mars 2026 et est passé sous une gouvernance neutre, au sein de l'Agentic AI Foundation de la Linux Foundation, en décembre 2025, avec AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft et OpenAI comme membres platine.

Le courant réglementaire va dans le même sens

Une seconde force pousse les données industrielles vers un format lisible par machine, et elle n'a rien à voir avec l'IA.

Le règlement d'exécution (UE) 2026/1778 de la Commission, adopté le 16 juillet 2026, a fixé les modalités de fonctionnement du registre du passeport numérique de produit institué par le règlement sur l'écoconception des produits durables — structure, vérification d'identité, enregistrement, preuve d'enregistrement, journalisation et conservation. La Commission a lancé le registre quelques jours plus tard. Les produits de construction suivent une voie distincte, au titre du règlement révisé sur les produits de construction, selon un calendrier plus long.

Retirez le vocabulaire de la conformité et il reste ceci : des données produits structurées et lisibles par machine, avec une identité et une traçabilité vérifiées, récupérables par un tiers. C'est presque mot pour mot la description d'un catalogue prêt pour les agents. Tout fabricant qui traite la conformité DPP et la lisibilité par l'IA comme deux programmes sans rapport, dotés de deux budgets, construit deux fois le même actif.

Ce qu'un fabricant devrait réellement faire

  1. 01Testez ce que voit une machine. Récupérez vos propres pages catalogue avec un simple client non navigateur. Lorsque Partsgraph a audité 984 domaines de distributeurs et de fabricants dans le monde en août 2026, 38 % ne renvoyaient aucune page catalogue lisible à un client non navigateur standard, et le score médian de visibilité IA s'établissait à 50 sur 100. Le rendu côté client est le coupable habituel, et il reste invisible dans toutes les vues analytiques classiques.
  2. 02Rédigez une politique explicite à l'égard des crawlers, et publiez-la. Décidez, catégorie par catégorie, ce que vous autorisez : indexation pour la recherche, récupération pour les réponses, accès des agents, entraînement. Dans le même audit, seuls 19 % des 984 domaines publiaient une politique explicite à l'égard des crawlers IA nommant les principaux bots — autrement dit, quatre sur cinq s'en remettent au réglage par défaut que leur choisit leur fournisseur de CDN ; et à mesure que ces réglages se durcissent en périphérie, le silence se résout en « non ».
  3. 03Vérifiez les réglages par défaut de votre CDN avant le 15 septembre 2026. Si vous êtes sur une formule gratuite ou si vous lancez de nouveaux sites, ces réglages changent sans vous prévenir. C'est une tâche de dix minutes que personne n'a inscrite à son agenda.
  4. 04Ne bloquez pas sans discernement. Copier la posture de blocage d'un éditeur revient à optimiser un chiffre d'affaires que vous ne réalisez pas, en renonçant à une distribution dont vous avez bel et bien besoin.
  5. 05Servez les données durables en statique et les données volatiles en direct. Les paramètres techniques, le statut de conformité et le cycle de vie peuvent être rendus côté serveur et structurés. Le stock, le délai et le prix contractuel ne peuvent être crawlés correctement à aucune fréquence de rafraîchissement : leur place est derrière un point d'accès interrogeable.
  6. 06Préparez-vous à l'identité, pas seulement à l'accès. Les agents signés rendront possibles des réponses tenant compte des droits de chacun. Les fournisseurs qui auront déjà normalisé leurs données de prix et de disponibilité pourront s'en servir ; les autres passeront cette fenêtre à faire du nettoyage de données.
  7. 07Surveillez l'exactitude, pas seulement la visibilité. Un délai faux annoncé avec aplomb fait plus de dégâts commerciaux qu'un délai absent, et ni l'un ni l'autre n'apparaît dans un rapport de positionnement.

Pourquoi être le premier compte ici plus qu'ailleurs

Il existe une raison précise d'agir tôt, et ce n'est pas l'argument habituel de la course à la conquête.

Les assistants convergent. Lorsqu'un modèle trouve une source qui répond correctement et à faible coût à toute une classe de questions — une source qui s'analyse sans ambiguïté, résout les références de pièces de façon cohérente et ne se contredit pas d'une page à l'autre — cette source devient le chemin de moindre résistance pour l'ensemble de la classe. Elle est davantage récupérée, davantage citée, puis renforcée au cycle d'entraînement suivant comme dans les index de récupération bâtis par-dessus.

Ce n'est pas un classement que vous pourrez racheter plus tard avec un budget plus important, car le mécanisme n'est pas une enchère. C'est un choix par défaut. Et les choix par défaut industriels sont d'une ténacité inhabituelle, parce qu'ils se figent dans des documents qui perdurent : une liste de fournisseurs agréés, un cahier des charges type, une nomenclature modèle. Une pièce qui devient la réponse par défaut en 2026 figure encore dans le modèle en 2031.

Le corollaire est inconfortable pour quiconque attend que le tableau s'éclaircisse. Le coût d'arriver tôt, c'est un projet de données. Le coût d'arriver tard, ce n'est pas le même projet de données mené plus tard — c'est un projet de données mené plus tard face à un concurrent qui est déjà la réponse par défaut.

L'outil d'évaluation gratuit sur [/audit](/audit) montre exactement ce qu'une machine lit aujourd'hui dans votre catalogue, et où sont les lacunes.

Questions fréquentes

Qu'est-ce qui change le 15 septembre 2026 ?

Cloudflare commence à catégoriser le trafic des crawlers IA en Search, Agent ou Training, au lieu de le traiter comme une classe unique. À compter de cette date, les crawlers Training et Agent sont bloqués par défaut sur les pages qui affichent de la publicité, et les crawlers à usage mixte qui refusent de déclarer leur finalité requête par requête y sont bloqués intégralement. Ces valeurs par défaut s'appliquent aux nouveaux clients, aux nouveaux sites créés par des clients existants et à tous les sites existants de la formule gratuite ; les clients payants peuvent les remplacer au préalable dans les paramètres de sécurité.

Cela affecte-t-il le catalogue produits d'un fabricant ?

En général pas directement, car ces réglages par défaut se déclenchent sur les pages porteuses de publicité et la plupart des catalogues de fabricants n'affichent aucune publicité. L'enjeu est réel, mais indirect, pour deux raisons. D'abord, la presse professionnelle, les contenus des distributeurs et les forums techniques où vos pièces sont discutées vivent fréquemment de la publicité : la couverture de vos produits par des tiers risque donc de devenir moins accessible aux assistants. Ensuite, cela installe le précédent selon lequel l'accès des crawlers est une autorisation facturée et accordée finalité par finalité — et ce modèle va se diffuser.

Qu'est-ce que le ratio crawl-to-refer, et pourquoi compte-t-il ?

C'est le nombre de pages qu'une entreprise d'IA crawle pour chaque visiteur qu'elle renvoie. Cloudflare a commencé à publier ces ratios sur Radar en 2025 : sur un échantillon de fin juin 2025, le crawler d'Anthropic se situait à environ 70 900 pages crawlées par visite référée, contre une norme historique en recherche de l'ordre de deux crawls ou moins par visiteur envoyé. Ce ratio explique pourquoi les éditeurs se sont mis à bloquer. Pour un fabricant, l'inversion est importante : vous ne vendez pas de publicité adossée au trafic, donc un ratio crawl-to-refer élevé n'est pas un coût pour vous — c'est de la distribution que vous ne payez pas.

Faut-il publier un fichier llms.txt ?

Cela ne coûte presque rien et ne produit presque rien. Ahrefs a analysé 137 210 domaines et constaté que 97 % des fichiers llms.txt publiés n'avaient reçu aucune requête en mai 2026 ; la plupart des récupérations effectivement observées provenaient d'outils SEO plutôt que de systèmes d'IA, sans aucun gain de citation mesurable. Publiez-en un si cela ne coûte rien, mais ne le laissez jamais se substituer à des pages rendues côté serveur, à des données structurées, à des flux ou à un point d'accès.

Qu'est-ce que Web Bot Auth, et pourquoi un fabricant devrait-il s'y intéresser ?

C'est un moyen, pour un client automatisé, de prouver cryptographiquement son identité à l'aide des HTTP Message Signatures, d'une clé Ed25519 par agent et d'un en-tête Signature-Agent, plutôt qu'en s'appuyant sur une chaîne user-agent facile à usurper. Cloudflare a livré les agents signés en août 2025, avec une première cohorte incluant ChatGPT agent et Goose, de Block, et les travaux progressent aujourd'hui au sein de l'IETF. C'est important parce qu'il s'agit de la condition préalable pour servir des données différentes à des agents différents — c'est ainsi que les prix contractuels et la disponibilité propre à chaque client finiront par parvenir aux agents en toute sécurité.

Bloquer les crawlers IA est-il un réglage par défaut raisonnable pour un fournisseur industriel ?

Presque jamais. Le blocage se justifie lorsque votre contenu est le produit et que le trafic est le chiffre d'affaires — édition, médias, recherche. Pour un fabricant ou un distributeur, le catalogue est un support marketing au service d'un produit physique, et être absent de la réponse d'un assistant coûte une prescription. La posture correcte est sélective : ouvrez le catalogue, publiez une politique explicite à l'égard des crawlers, et facturez ou authentifiez l'accès à ce qui est réellement sensible sur le plan commercial, comme les prix contractuels.

Comment la réglementation européenne interagit-elle avec tout cela ?

Elle pousse dans le même sens, pour un motif différent. Le règlement d'exécution (UE) 2026/1778 de la Commission, du 16 juillet 2026, a fixé les règles de fonctionnement du registre européen du passeport numérique de produit prévu par l'ESPR, registre que la Commission a lancé quelques jours plus tard. Les produits de construction sont traités séparément, au titre du règlement révisé sur les produits de construction, selon un calendrier plus tardif. L'exigence de conformité porte sur des données produits structurées et lisibles par machine, avec une identité et une traçabilité vérifiées — c'est-à-dire, pour l'essentiel, le même actif que celui qu'exige le web agentique. Les fabricants qui le construisent deux fois, une fois pour Bruxelles et une fois pour les assistants, gaspillent leur budget.

Sources

  1. 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
  2. 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
  3. 03Cloudflare, Introducing pay per crawl
  4. 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
  5. 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
  6. 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
  7. 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
  8. 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
  9. 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
  10. 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
  11. 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
Lancez-le sur votre propre catalogue

Voyez exactement ce que les assistants IA peuvent lire — ou non — de vos produits aujourd'hui : politique d'accès des crawlers, couverture du catalogue, accès aux fiches techniques. Le tout noté et comparé à 984 distributeurs et fabricants dans le monde.

Évaluer mon catalogue

Notes de terrain associées