Perché l'IA non riesce a leggere i tuoi datasheet

Pubblicato il 2026-08-099 min di letturadatasheets · PDF · AI crawlers · product data

In breve

Perché gli assistenti IA non riescono a leggere i datasheet dei miei prodotti?

Quattro cose rendono i datasheet illeggibili per l'IA: il PDF è bloccato da una barriera anti-bot o da un login prima ancora che un crawler possa scaricarlo; il file è una scansione di sola immagine priva di livello di testo, quindi l'estrazione restituisce zero caratteri; il documento è imprigionato in un viewer JavaScript senza un URL diretto al file; oppure risiede su un host documentale separato il cui robots.txt dice no. Ne basta una sola per rendere irraggiungibile la specifica definitiva del tuo componente, e la specifica vive proprio nel datasheet: la pagina web ne porta sempre e soltanto una sintesi.

La risposta breve

Un datasheet diventa invisibile all'IA in uno di quattro modi, e sono tutti banali. Il file viene bloccato prima ancora di essere scaricato, da una regola anti-bot, da un login o da un interstitial. Il file è un'immagine scansionata priva di livello di testo, quindi un estrattore ne ricava zero caratteri. Il documento è raggiungibile soltanto attraverso un viewer JavaScript, senza URL diretto. Oppure il PDF risiede su un host documentale separato — docs., media., un DAM, una CDN — il cui robots.txt o WAF dice no, per quanto permissivo sia il tuo sito principale.

None of these are exotic, all four are common, and any one of them is sufficient on its own. The datasheet is the specification of record — when AI can read the product page but not the source, it answers engineering questions from the summary.

Nessuno di questi casi è esotico. Tutti e quattro sono frequenti, e ne basta uno solo. Vale la pena dirlo con chiarezza:

Il datasheet è la specifica ufficiale. La pagina di prodotto ne è una sintesi. Quando l'IA riesce a leggere la sintesi ma non la fonte, risponde alle domande tecniche a partire dalla sintesi — e sbaglia.

Perché qui i datasheet contano più delle pagine web

Una pagina di prodotto porta forse da otto a venti attributi: package, rating principale, un indicatore di ciclo di vita, prezzo, disponibilità. Un datasheet ne porta centinaia: valori massimi assoluti, caratteristiche elettriche al variare della temperatura, diagrammi di temporizzazione, descrizione dei pin, valori di resistenza termica, footprint consigliati, livello di sensibilità all'umidità, decodifiche dei codici di ordinazione. Quasi tutte le domande che un progettista pone davvero a un assistente — posso alimentarlo a 5,5 V, qual è la corrente di riposo a 85 gradi, la piedinatura è compatibile con il componente che sto sostituendo — trovano risposta nel datasheet e in nessun altro posto.

Oggi questo conta più di ieri, perché le domande vengono poste agli assistenti anziché digitate nel tuo campo di ricerca. Nel gennaio 2026 Forrester ha rilevato che il 94% dei buyer aziendali utilizza ormai l'IA durante il processo d'acquisto. E le pagine che portano la maggiore profondità tecnica sono quelle con i risultati peggiori: l'analisi Adobe dell'aprile 2026 sulla leggibilità da parte delle macchine nel retail ha assegnato alle pagine di dettaglio prodotto un punteggio del 66%, il più basso fra tutti i tipi di pagina, sotto le homepage al 75% e le pagine FAQ all'80%.

Quando il dato sottostante non è raggiungibile, l'esito non è il silenzio: è l'errore detto con sicurezza. Nel marzo 2026 OpenAI ha chiuso progressivamente Instant Checkout di ChatGPT, con una trentina di merchant attivi, e l'inaccuratezza dei dati di prodotto è stata una delle ragioni centrali: OpenAI raccoglieva le informazioni di prodotto dai siti retail e i dati di disponibilità, spedizione e prezzo risultavano spesso errati. È lo stesso modo di fallire di un valore massimo sbagliato, con una posta in gioco più bassa.

I cinque modi in cui un datasheet diventa illeggibile

ProblemaChe cosa vede un crawlerCome individuarlo
Barriera anti-bot403, 429 o una pagina HTML di challenge al posto di un PDFIl content-type della risposta è text/html, non application/pdf
Scansione di sola immagineUn PDF valido che non contiene testo estraibileL'estrazione del testo restituisce 0 caratteri; nessun font incorporato
Documento solo in viewerUna pagina di JavaScript senza URL del fileIl PDF viene caricato da un blob o da uno stream autenticato
Policy dell'host separatoUn 200 pulito sulla pagina di prodotto, un blocco sul documentoL'host dei documenti ha un proprio robots.txt e un proprio WAF
URL effimero o vincolatoUn link firmato che scade, oppure un form di accessoIl link funziona nel tuo browser e restituisce 403 da curl

Il quinto è il più autoinflitto. URL firmati a vita breve, gate del tipo «registrati per scaricare» e token monouso sono tutti muri invisibili: un crawler non ha sessione, non ha cookie e non compila moduli. E poiché i crawler IA non eseguono JavaScript, qualunque link di download scritto nel DOM da uno script semplicemente non esiste dal loro lato del filo.

Come verifico se i miei datasheet sono leggibili?

Bastano tre comandi. Eseguili sui tuoi documenti.

  1. 01Controlla il fetch. L'URL restituisce un PDF a un client semplice, che non sia un browser?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"

Vuoi ottenere un 200 finale e content-type: application/pdf. Un content-type: text/html significa che ti è stata servita una challenge o una pagina di login travestita da download.

  1. 01Scaricalo e verifica che sia davvero un PDF.
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdf

I primi cinque byte devono essere %PDF-. Se sono <!DOC, hai scaricato una pagina di errore.

  1. 01Verifica il livello di testo. È il controllo che non esegue nessuno.
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdf

Come capisco se un PDF ha un livello di testo?

Due numeri, e il divario fra loro è inequivocabile. Abbiamo eseguito entrambi i test su un datasheet reale e attuale di un costruttore — l'LM358 di Texas Instruments, un PDF da 4,15 MB — e su una copia rasterizzata dello stesso documento, che è esattamente ciò che una macchina vede quando incontra un vecchio datasheet scansionato.

TestDatasheet realeScansione di sola immagine
Caratteri estratti da pdftotext95.8950
Righe di font incorporati in pdffonts1140
Visivamente identico per una persona
Utilizzabile da un assistente IANo

È tutta qui la diagnosi. Zero caratteri estraibili e zero font incorporati significano che nel file non c'è testo: c'è soltanto un'immagine di testo. Il documento si visualizza perfettamente per una persona e non contribuisce letteralmente in nulla a un modello. Un datasheet scansionato degli anni Novanta, relativo a un componente ancora in produzione, per qualsiasi sistema IA in rete è una pagina bianca.

Due precisazioni utili. Un conteggio di caratteri basso ma diverso da zero — diciamo qualche centinaio di caratteri su un documento di quaranta pagine — di solito indica un corpo scansionato con un'intestazione testuale, ed è altrettanto inutilizzabile. E nell'output di pdffonts conta la colonna uni: i font forniti in subset senza una mappa ToUnicode possono essere estratti come mojibake anche se tecnicamente i caratteri ci sono. Controlla a campione i primi 200 caratteri del testo estratto, invece di fidarti del solo conteggio.

Per passare al setaccio un'intera libreria, mettilo in un ciclo:

while read -r url; do
  code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
  chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
  echo "$code $chars $url"
done < datasheet-urls.txt

Ordina l'output per numero di caratteri crescente. Tutto ciò che sta in cima a quella lista è un buco nei tuoi dati di prodotto.

La trappola dell'host separato

Questa coglie in fallo quasi tutte le grandi organizzazioni, proprio perché è la conseguenza di aver fatto le cose per bene. I documenti vengono spostati in un DAM, in un sottodominio di documentazione o su una CDN, e ognuno di questi è un'origine distinta, con una propria configurazione — e spesso con un proprio responsabile.

Secondo la RFC 9309, robots.txt ha validità limitata a una singola origine: schema, host e porta. https://www.example.com/robots.txt non governa nulla su https://docs.example.com/ e nulla su https://cdn.example-media.net/. Se il tuo sito principale accoglie i crawler IA e il tuo host documentale è stato messo in piedi da un template predefinito con un Disallow: / generalizzato, oppure sta dietro un bot manager configurato per sfidare tutto ciò che non è umano, allora la tua intera libreria tecnica è al buio mentre il sito di marketing è spalancato.

Controlla ogni origine che serve un documento:

for h in www.example.com docs.example.com cdn.example-media.net; do
  echo "--- $h"
  curl -sS --max-time 15 "https://$h/robots.txt" | head -30
done

Che aspetto ha una pubblicazione fatta bene

Un datasheet pubblicato correttamente non ha nulla di notevole, ed è esattamente questo il punto. Texas Instruments serve il datasheet dell'LM358 a un URL stabile e prevedibile sotto /lit/ds/; il suo robots.txt non pone alcuna restrizione su quel percorso; il file restituisce 200 con content-type: application/pdf a un client non browser che si identifica come GPTBot; e il PDF porta un livello di testo completo, con font incorporati e mappati in Unicode. Nessun login, nessun viewer, nessun URL firmato, nessun interstitial. Qualsiasi pipeline di estrazione al mondo è in grado di leggerlo.

La direzione di marcia nel settore dei componenti è quella di rendere tutto questo ancora più semplice. Nel novembre 2025 Microchip ha pubblicato un server MCP gratuito e senza autenticazione per i propri dati di prodotto — specifiche, datasheet, disponibilità, prezzi e tempi di consegna — e nel giugno 2026 TrustedParts di ECIA ha lanciato un servizio di agente IA per l'inventario che espone la disponibilità dei distributori autorizzati a Copilot, ChatGPT e Claude. Entrambi nascono dalla stessa consapevolezza: un documento per cui una macchina deve combattere è un documento che perde.

Come si risolve?

In ordine di ritorno sull'impegno richiesto:

  1. 01Sblocca i percorsi dei documenti. Consenti l'accesso dei crawler IA a /datasheets/*, /lit/*, /documents/* e percorsi equivalenti, sul WAF oltre che nel robots.txt. Sono due interruttori distinti e vanno impostati entrambi.
  2. 02Elimina i gate di download dai documenti tecnici pubblici. Se un datasheet è sul tuo sito pubblico, è già pubblico. Un modulo di registrazione ferma soltanto le macchine che ti avrebbero raccomandato.
  3. 03Applica l'OCR a ogni PDF di sola immagine e ripubblicalo con un livello di testo. Dai priorità in base al fatturato del componente, non all'età del documento. L'OCR moderno su una scansione pulita a 300 dpi è quasi senza perdite sul testo corrente; verifica a mano le tabelle dei parametri.
  4. 04Dai a ogni documento un URL stabile, diretto e collegabile. Niente blob, niente viewer, niente token che scadono, niente query string ?token=.
  5. 05Pubblica un gemello HTML o markdown di ogni datasheet. Le tabelle delle specifiche come tabelle vere. È la singola modifica più efficace, perché elimina ogni dipendenza dalle euristiche di layout dei PDF e ti dà una pagina di cui puoi anche monitorare l'accuratezza.
  6. 06Collega il documento dalla pagina di prodotto in HTML renderizzato lato server, così un crawler che raggiunge la pagina può raggiungere il documento senza eseguire nulla.
  7. 07Esponi i parametri estratti come dati strutturati — JSON-LD nella pagina e, idealmente, un endpoint interrogabile — così un agente può filtrarli invece di ri-analizzare ogni volta un PDF.

Nell'agosto 2026 Partsgraph ha analizzato 984 domini di distributori e produttori in tutto il mondo, fra Nord America, Europa e Asia. Il punteggio mediano di visibilità IA è stato 50 su 100 e il 70% del campione ha ottenuto una valutazione D o F. Il livello documentale è risultato sistematicamente la componente più debole del punteggio: il 38% non è riuscito a servire nemmeno una pagina di catalogo leggibile a un normale client non browser, e l'accesso ai documenti ha fallito più spesso dell'accesso alle pagine.

La parte scomoda è che nulla di tutto questo compare nelle tue analytics. Un crawler bloccato non apre una segnalazione di bug, un OCR mal riuscito non solleva un'eccezione, e un modello che non riesce a leggere il tuo datasheet non dice all'acquirente che non è riuscito a leggerlo. Si limita a raccomandare un concorrente il cui PDF si è aperto.

Puoi verificare la tua libreria documentale con questi stessi test usando il grader gratuito di visibilità IA di Partsgraph su [/audit](/audit).

Domande frequenti

I crawler IA riescono davvero a leggere i PDF?

Possono scaricarli, e l'estrazione del testo dai PDF è una componente standard delle pipeline di ingestione. Quello che non possono fare è inventare testo che nel file non c'è. L'estrazione legge il livello di testo; se il PDF è un'immagine scansionata priva di livello di testo, l'estrazione non restituisce nulla e il documento non contribuisce in alcun modo.

Come faccio a capire se un PDF ha un livello di testo?

Esegui pdftotext sul file e conta i caratteri restituiti, poi esegui pdffonts e conta le righe. Un datasheet in buona salute restituisce decine di migliaia di caratteri e un lungo elenco di font incorporati. Una scansione di sola immagine restituisce zero caratteri e zero font.

I miei datasheet stanno su un sottodominio di documentazione separato. È un problema?

Sì. Secondo la RFC 9309, robots.txt ha validità limitata a una singola origine: schema, host e porta. Un robots.txt permissivo su www.example.com non concede nulla su docs.example.com né sul nome host della tua CDN. Ogni origine che serve documenti ha bisogno di una propria policy, e ciascuna è soggetta separatamente alle regole del tuo WAF.

Conviene pubblicare i contenuti del datasheet sulla pagina web in HTML?

Sì, ed è di solito l'intervento con il ritorno più alto. Un gemello HTML o markdown di ogni datasheet — tabelle delle specifiche, valori massimi assoluti, descrizione dei pin, informazioni di ordinazione — è banalmente analizzabile, memorizzabile in cache e citabile, ed elimina qualsiasi dipendenza dal modo in cui un estrattore PDF gestisce il tuo impaginato.

Bloccare i bot sul mio host documentale protegge la mia proprietà intellettuale?

Ti protegge soprattutto dall'essere raccomandato. I datasheet sono già replicati sugli aggregatori, quindi bloccare il crawler raramente rimuove il contenuto dal corpus di addestramento: significa soltanto che la versione vista dal modello è la copia obsoleta di terze parti anziché la tua revisione attuale. Se l'obiettivo è il controllo, servi il documento autorevole e monitora l'accuratezza.

Gli impaginati multicolonna e le tabelle sopravvivono all'estrazione?

In modo imperfetto. Gli impaginati dei datasheet su due colonne spesso si intrecciano quando vengono estratti in modo lineare, e le tabelle di parametri con celle unite perdono la struttura delle righe. I PDF taggati con un ordine di lettura corretto aiutano parecchio, ma un mirror HTML o markdown delle stesse tabelle elimina del tutto l'ambiguità.

Quanti datasheet dovrei testare?

Testa prima i tuoi 20 documenti più visitati, poi passa al setaccio l'intera libreria con uno script. Per nostra esperienza i problemi si concentrano per epoca e per strumento di authoring, quindi un campione che copre solo i componenti recenti farà apparire la libreria molto più in salute di quanto sia davvero.

Fonti

  1. 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
  2. 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
  3. 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
  4. 04Forrester, The State Of Business Buying, 2026 (January 2026)
  5. 05Vercel and MERJ, The rise of the AI crawler, December 2024
  6. 06RFC 9309, Robots Exclusion Protocol
  7. 07Microchip Technology, MCP Server press release, November 2025
  8. 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
  9. 09Texas Instruments, LM358 datasheet (used as a worked example)
Provalo sul tuo catalogo

Scopri esattamente cosa riescono a leggere oggi gli assistenti IA dei tuoi prodotti e cosa no: policy di accesso per i crawler, copertura del catalogo, accesso alle schede tecniche — con un punteggio e il confronto con 984 distributori e produttori in tutto il mondo.

Valuta il mio catalogo

Note dal campo correlate