Il web agentico e i dati di prodotto industriali

Pubblicato il 2026-08-0911 min di letturaagentic web · crawlers · Cloudflare · Web Bot Auth

In breve

In che modo il web agentico sta cambiando ciò che i produttori industriali devono pubblicare?

Il web si sta separando in una superficie umana, ottimizzata per i browser, e una superficie per le macchine, ottimizzata per gli agenti: due ambienti governati con regole diverse. Il traffico automatizzato supera già quello umano — Imperva ha misurato che nel 2025 il 53% del traffico web era automatizzato — e i fornitori di infrastruttura hanno iniziato a tariffarlo: dal 15 settembre 2026 Cloudflare blocca per impostazione predefinita i crawler di addestramento IA e quelli agentici sulle pagine con pubblicità, per i siti nuovi e per quelli del piano gratuito, mentre il pay-per-crawl e l'identità dell'agente firmata crittograficamente si affermano come alternative al blocco indiscriminato. Per un produttore la conseguenza pratica è che essere scansionabile non equivale più a essere raggiungibile, e le aziende che diventano per prime accurate e raggiungibili diventano la risposta predefinita.

Il web ha ora due pubblici, e solo uno dei due ha gli occhi

Per trent'anni pubblicare sul web ha significato pubblicare per una persona con il mouse in mano. Tutto ciò che ne discendeva — layout, framework JavaScript, banner dei cookie, analytics, inventario pubblicitario — dava per scontato un essere umano dall'altra parte.

Nothing in the top row changes. The layer reads from what already exists and publishes it in the shapes agents actually request.

Quel presupposto oggi è falso più spesso di quanto sia vero. Il Bad Bot Report 2026 di Imperva ha rilevato che nel 2025 il traffico automatizzato ha rappresentato il 53% di tutto il traffico web, in crescita dal 51%, con quello umano sceso al 47% e ancora in calo. Cloudflare ha fatto la stessa osservazione annunciando la propria policy sui crawler per il 2026: la maggior parte del traffico internet non è umana.

La conseguenza interessante non è la proporzione. È che i due pubblici vengono ormai governati separatamente: regole di accesso diverse, tariffe diverse, requisiti di identità diversi. Il web si sta biforcando in una superficie umana e una superficie per le macchine, e i produttori industriali non hanno dedicato un solo minuto a pensare alla seconda.

Perché l'economia del web si è rotta?

La ricerca funzionava perché era uno scambio. Un crawler prendeva la vostra pagina e restituiva visitatori. Gli editori accettavano il patto perché il tasso di cambio era favorevole.

Il retrieval basato sull'IA ha fatto saltare quel tasso di cambio. Nel 2025 Cloudflare ha iniziato a pubblicare su Radar i rapporti crawl/referral — pagine scansionate per ogni referral inviato — e i numeri erano lontanissimi dalla norma della ricerca, un paio di scansioni o meno per visitatore. In un campione di fine giugno 2025 il crawler di Anthropic si collocava intorno a 70.900 pagine scansionate per referral. Sempre nel 2026 Cloudflare ha inoltre riferito che più della metà del traffico di scansione IA se ne va nel riscaricare pagine che non sono cambiate.

Nel frattempo il lato umano dello scambio si è assottigliato per conto proprio. SparkToro ha misurato che all'inizio del 2026 il 68% delle ricerche Google negli Stati Uniti si concludeva senza alcun clic, con circa 276 clic ogni 1.000 ricerche diretti verso il web aperto, in calo rispetto ai 374 del 2024.

Gli editori si sono così trovati davanti a un'estrazione crescente e a una remunerazione calante, e hanno fatto la cosa prevedibile.

Attenzione però: questa logica vale soltanto per le aziende il cui contenuto è il prodotto. La scheda tecnica di un produttore non si monetizza con le pagine viste. È materiale di marketing a supporto di un oggetto fisico che vendete con un margine. Se un assistente legge il vostro intero catalogo 70.000 volte e vi manda un solo progettista che specifica il vostro componente in un programma da 500.000 pezzi, avete vinto. La lamentela degli editori sul rapporto crawl/referral, importata senza esame in un contesto industriale, produce esattamente la policy sbagliata.

Che cosa fanno davvero i caselli

MeccanismoDi che cosa si trattaStatoRilevanza per un produttore
Classificazione per finalitàCloudflare separa il traffico IA in Search, Agent e Training, ciascuno controllabile a parteAttiva; nuove impostazioni predefinite dal 15 settembre 2026Alta — la policy per ciascuna categoria dovreste deciderla voi, invece di ereditarla
Blocco predefinito sulle pagine con pubblicitàCrawler Training e Agent bloccati per impostazione predefinita sulle pagine con pubblicità; i crawler a uso misto vi sono bloccati del tuttoDal 15 settembre 2026, per i nuovi clienti, i nuovi siti e i siti già attivi sul piano gratuitoIndiretta — difficilmente il vostro catalogo ospita pubblicità, ma la stampa di settore che parla dei vostri componenti sì
Pay-per-crawlRisposte HTTP 402 che indicano un prezzo, con gli header crawler-max-price, crawler-exact-price e crawler-charged, regolate sull'edgeBeta privataBassa oggi; è un segnale della direzione che sta prendendo la tariffazione
Web Bot Auth / agenti firmatiIdentità crittografica dell'agente tramite HTTP Message Signatures e un header Signature-Agent, al posto delle stringhe user-agentRilasciata da Cloudflare nell'agosto 2025; in corso di standardizzazione presso l'IETFAlta — è la precondizione per servire dati riservati a un agente conosciuto

L'ultima riga è quella che conta sul piano commerciale, ed è quella di cui nessuno, nella fornitura industriale, sta parlando.

Tutto ciò su cui un fornitore industriale davvero compete — prezzi contrattuali, scorte allocate, tempi di consegna specifici per cliente, elenchi di alternative approvate — è fatto di dati che non potete pubblicare apertamente. Oggi questo significa che gli agenti ottengono il prezzo di listino pubblico e una stringa di disponibilità generica: ottengono cioè qualcosa di sbagliato. L'identità verificabile dell'agente è ciò che trasforma «non possiamo esporlo» in «possiamo esporlo a questo agente, che agisce per questo cliente, e registrarlo a log». Non è una storia di blocco dei crawler. È una storia di abilitazione del canale, che per caso viaggia sulle stesse tubature.

La lezione di llms.txt

Vale la pena soffermarsi su llms.txt, perché è l'illustrazione perfetta di come questo mercato allochi male gli sforzi.

La proposta era ragionevole: un file di testo semplice che indica ai sistemi di IA dove si trovano i vostri contenuti migliori. È stata adottata su larga scala. Ne ha parlato ogni newsletter di marketing. Poi Ahrefs ha analizzato 137.210 domini e ha scoperto che nel maggio 2026 il 97% dei file llms.txt pubblicati non ha ricevuto alcuna richiesta. La maggior parte dei prelievi effettivamente registrati proveniva da strumenti di audit SEO e non da sistemi di IA, e lo studio non ha trovato prova di alcun aumento delle citazioni in ChatGPT, Perplexity o AI Overviews.

Nello stesso dataset, però, i bot IA rappresentavano il 19,5% di tutte le richieste, con l'infrastruttura agentica come categoria IA più ampia, al 10,5%. Le macchine c'erano eccome. Solo che scaricavano le vostre pagine vere — quelle che molti produttori renderizzano lato client e quindi servono vuote.

La lezione va oltre il singolo file. L'adozione di una convenzione non coincide con il suo utilizzo. La verifica affidabile non è se uno standard abbia slancio nel dibattito, ma se i client reali lo scarichino davvero. Al momento due cose superano questa prova: l'HTML renderizzato lato server e gli endpoint del Model Context Protocol — MCP ha raggiunto circa 97 milioni di download mensili degli SDK entro marzo 2026 ed è passato a una governance neutrale sotto l'Agentic AI Foundation della Linux Foundation nel dicembre 2025, con AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft e OpenAI come membri platinum.

La corrente normativa va nella stessa direzione

C'è una seconda forza che spinge i dati industriali verso un formato leggibile dalle macchine, e non ha nulla a che vedere con l'IA.

Il regolamento di esecuzione (UE) 2026/1778 della Commissione, adottato il 16 luglio 2026, ha stabilito le modalità operative del registro del passaporto digitale di prodotto istituito dal regolamento sulla progettazione ecocompatibile dei prodotti sostenibili: struttura, verifica dell'identità, registrazione, prova dell'avvenuta registrazione, log e conservazione. La Commissione ha attivato il registro pochi giorni dopo. I prodotti da costruzione seguono un binario separato, con tempistiche più lunghe, nell'ambito del regolamento sui prodotti da costruzione rivisto.

Togliete il linguaggio della compliance e il requisito diventa: dati di prodotto strutturati e leggibili dalle macchine, con identità e provenienza verificate, recuperabili da una terza parte. È quasi la definizione di un catalogo pronto per gli agenti. Qualsiasi produttore che tratti la conformità al DPP e la leggibilità per l'IA come due programmi scollegati, con due budget distinti, sta costruendo due volte lo stesso asset.

Che cosa dovrebbe fare concretamente un produttore

  1. 01Verificate che cosa vede una macchina. Scaricate le vostre pagine di catalogo con un semplice client che non sia un browser. Quando Partsgraph ha analizzato 984 domini di distributori e produttori in tutto il mondo, ad agosto 2026, il 38% non restituiva alcuna pagina di catalogo leggibile a un normale client non-browser, e il punteggio mediano di visibilità IA era 50 su 100. Il colpevole abituale è il rendering lato client, ed è invisibile in qualunque vista analytics ordinaria.
  2. 02Scrivete una policy esplicita per i crawler e pubblicatela. Decidete, categoria per categoria, che cosa consentite: indicizzazione per la ricerca, retrieval per le risposte, accesso degli agenti, addestramento. Nello stesso audit, solo il 19% dei 984 domini pubblicava una policy esplicita per i crawler IA che nominasse i bot principali — il che significa che quattro su cinque si affidano a qualunque impostazione predefinita scelga per loro il fornitore della CDN; e via via che le impostazioni predefinite sull'edge si irrigidiscono, il silenzio si traduce in «no».
  3. 03Controllate le impostazioni predefinite della vostra CDN prima del 15 settembre 2026. Se siete su un piano gratuito o state avviando nuove property, le impostazioni predefinite cambiano sotto i vostri piedi. È un'attività da dieci minuti che nessuno ha messo in agenda.
  4. 04Non bloccate in modo indiscriminato. Copiare l'atteggiamento di blocco di un editore ottimizza per un ricavo che non incassate e rinuncia a una distribuzione di cui invece avete bisogno.
  5. 05Servite i dati stabili in modo statico e quelli volatili in tempo reale. Parametri tecnici, stato di conformità e ciclo di vita possono essere renderizzati lato server e strutturati. Giacenze, tempi di consegna e prezzo contrattuale non si lasciano scansionare correttamente a nessuna frequenza di aggiornamento: il loro posto è dietro un endpoint interrogabile.
  6. 06Preparatevi all'identità, non solo all'accesso. Gli agenti firmati renderanno possibili risposte consapevoli dei diritti di accesso. I fornitori che avranno già normalizzato i dati di prezzo e disponibilità potranno sfruttarle; gli altri passeranno quella finestra a ripulire i dati.
  7. 07Monitorate l'accuratezza, non solo la visibilità. Un tempo di consegna sbagliato ma dichiarato con sicurezza fa più danni commerciali di uno assente, e nessuno dei due compare in un report di posizionamento.

Perché qui essere primi conta più del solito

C'è una ragione precisa per muoversi presto, e non è il consueto argomento della corsa all'accaparramento.

Gli assistenti convergono. Quando un modello trova una fonte che risponde in modo corretto ed economico a un'intera classe di domande — una fonte che si interpreta senza ambiguità, risolve i codici articolo in modo coerente e non si contraddice da una pagina all'altra — quella fonte diventa il percorso di minor resistenza per l'intera classe. Viene recuperata più spesso, citata più spesso e rinforzata nel giro di addestramento successivo e negli indici di retrieval costruiti su di esso.

Non è un posizionamento che potrete ricomprare più avanti con un budget più grande, perché il meccanismo non è un'asta. È un'impostazione predefinita. E le impostazioni predefinite industriali sono insolitamente tenaci, perché si sedimentano in documenti destinati a durare: un elenco di fornitori approvati, una specifica standard, una distinta base modello. Un componente che diventa la risposta predefinita nel 2026 nel 2031 è ancora lì, nel modello.

Il corollario è scomodo per chi aspetta che il quadro si chiarisca. Il costo di muoversi presto è un progetto sui dati. Il costo di muoversi tardi non è lo stesso progetto sui dati fatto più avanti: è un progetto sui dati fatto più avanti contro un concorrente che è già la risposta predefinita.

Il grader gratuito su [/audit](/audit) mostra esattamente che cosa una macchina legge oggi dal vostro catalogo, e dove sono le lacune.

Domande frequenti

Che cosa cambia il 15 settembre 2026?

Cloudflare inizia a classificare il traffico dei crawler IA in tre categorie — Search, Agent e Training — invece di trattarlo come un'unica classe. Da quella data i crawler di addestramento (Training) e quelli agentici (Agent) sono bloccati per impostazione predefinita sulle pagine che mostrano pubblicità, e i crawler a uso misto che non dichiarano la propria finalità richiesta per richiesta vengono bloccati del tutto su quelle pagine. Le impostazioni predefinite si applicano ai nuovi clienti, ai nuovi siti creati da clienti esistenti e a tutti i siti già attivi sul piano gratuito; i clienti paganti possono modificarle in anticipo nelle impostazioni di sicurezza.

Questo riguarda il catalogo prodotti di un produttore?

Di norma non in modo diretto, perché le impostazioni predefinite si attivano sulle pagine con pubblicità e la maggior parte dei cataloghi dei produttori non ne ospita. Conta però per due ragioni indirette. La prima: le riviste di settore, i contenuti dei distributori e i forum tecnici in cui si parla dei vostri componenti vivono spesso di pubblicità, quindi la copertura dei vostri prodotti da parte di terzi potrebbe diventare meno accessibile agli assistenti. La seconda: si afferma il precedente per cui l'accesso dei crawler è un permesso tariffato e concesso per singola finalità — e quel modello è destinato a diffondersi.

Che cos'è il rapporto crawl/referral e perché conta?

È il numero di pagine che un'azienda di IA scansiona per ogni visitatore che rimanda indietro. Cloudflare ha iniziato a pubblicare questi rapporti su Radar nel 2025: in un campione di fine giugno 2025 il crawler di Anthropic si attestava intorno a 70.900 pagine scansionate per ogni referral, contro la norma della ricerca tradizionale di un paio di scansioni o meno per visitatore inviato. È questo rapporto ad aver spinto gli editori a bloccare. Per un produttore, però, il ragionamento si ribalta: voi non vendete pubblicità sul traffico, quindi un rapporto crawl/referral elevato non è un costo — è distribuzione che non state pagando.

Conviene pubblicare un file llms.txt?

Costa quasi nulla e serve quasi a nulla. Ahrefs ha analizzato 137.210 domini e ha rilevato che nel maggio 2026 il 97% dei file llms.txt pubblicati non ha ricevuto alcuna richiesta; la maggior parte dei prelievi effettivamente registrati proveniva da strumenti SEO e non da sistemi di IA, senza alcun aumento misurabile delle citazioni. Pubblicatelo pure se non costa nulla, ma non lasciate mai che sostituisca pagine renderizzate lato server, dati strutturati, feed o un endpoint.

Che cos'è Web Bot Auth e perché dovrebbe interessare a un produttore?

È il modo in cui un client automatizzato dimostra crittograficamente la propria identità, usando le HTTP Message Signatures, una chiave Ed25519 per agente e un header Signature-Agent, invece di affidarsi a una stringa user-agent facilissima da falsificare. Cloudflare ha rilasciato gli agenti firmati nell'agosto 2025 con un primo gruppo che comprendeva ChatGPT agent e Goose di Block, e il lavoro sta ora procedendo in sede IETF. Conta perché è la precondizione per servire dati diversi ad agenti diversi — ed è così che i prezzi contrattuali e le disponibilità specifiche per cliente potranno un giorno raggiungere gli agenti in sicurezza.

Bloccare i crawler IA è una scelta predefinita sensata per un fornitore industriale?

Quasi mai. Bloccare ha senso quando il contenuto è il prodotto e il traffico è il fatturato: editoria, media, ricerca. Per un produttore o un distributore il catalogo è materiale di marketing a supporto di un prodotto fisico, e non comparire nella risposta di un assistente costa una specifica. L'atteggiamento corretto è selettivo: aprite il catalogo, pubblicate una policy esplicita per i crawler e tariffate o autenticate soltanto ciò che è davvero sensibile sul piano commerciale, come i prezzi contrattuali.

Come si intreccia la regolamentazione europea con tutto questo?

Spinge nella stessa direzione, ma per ragioni diverse. Il regolamento di esecuzione (UE) 2026/1778 della Commissione, del 16 luglio 2026, ha fissato le regole operative del registro europeo del passaporto digitale di prodotto previsto dall'ESPR, registro che la Commissione ha attivato pochi giorni dopo. I prodotti da costruzione sono trattati separatamente, con tempistiche più lunghe, nell'ambito del regolamento sui prodotti da costruzione rivisto. Il requisito di conformità è dato da dati di prodotto strutturati e leggibili dalle macchine, con identità e provenienza verificate — in sostanza lo stesso asset che richiede il web agentico. I produttori che lo costruiscono due volte, una per Bruxelles e una per gli assistenti, stanno sprecando budget.

Fonti

  1. 01TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)
  2. 02Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)
  3. 03Cloudflare, Introducing pay per crawl
  4. 04Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar
  5. 05Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)
  6. 06IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)
  7. 07Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)
  8. 08Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age
  9. 09SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click
  10. 10Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)
  11. 11EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)
Provalo sul tuo catalogo

Scopri esattamente cosa riescono a leggere oggi gli assistenti IA dei tuoi prodotti e cosa no: policy di accesso per i crawler, copertura del catalogo, accesso alle schede tecniche — con un punteggio e il confronto con 984 distributori e produttori in tutto il mondo.

Valuta il mio catalogo

Note dal campo correlate