Waarom AI uw datasheets niet kan lezen

Gepubliceerd op 2026-08-099 min leestijddatasheets · PDF · AI crawlers · product data

In het kort

Waarom kunnen AI-assistenten mijn productdatasheets niet lezen?

Vier dingen maken datasheets onleesbaar voor AI: de PDF wordt geblokkeerd door een botmuur of een login voordat een crawler hem kan ophalen; het bestand is een scan zonder tekstlaag, waardoor extractie nul tekens oplevert; het document zit gevangen in een JavaScript-viewer zonder directe bestands-URL; of het staat op een aparte documentatiehost waarvan de robots.txt nee zegt. Elk van deze vier maakt de definitieve specificatie van uw onderdeel onbereikbaar, en juist in de datasheet staat die specificatie — de webpagina bevat altijd niet meer dan een samenvatting.

Het korte antwoord

Een datasheet wordt op een van vier manieren onzichtbaar voor AI, en ze zijn stuk voor stuk banaal. Het bestand wordt geblokkeerd voordat het ooit is opgehaald, door een botregel, een login of een tussenpagina. Het bestand is een gescande afbeelding zonder tekstlaag, waardoor een extractor er nul tekens uit haalt. Het document is alleen bereikbaar via een JavaScript-viewer zonder directe URL. Of de PDF staat op een aparte documentatiehost — docs., media., een DAM, een CDN — waarvan de eigen robots.txt of WAF nee zegt, hoe permissief uw hoofdsite ook is.

None of these are exotic, all four are common, and any one of them is sufficient on its own. The datasheet is the specification of record — when AI can read the product page but not the source, it answers engineering questions from the summary.

Geen van deze vier is exotisch. Alle vier komen veel voor, en één ervan volstaat. Het gevolg mag onomwonden worden benoemd:

De datasheet is de specificatie die geldt. De productpagina is een samenvatting daarvan. Kan AI de samenvatting wel lezen maar de bron niet, dan beantwoordt hij technische vragen op basis van de samenvatting — en dan heeft hij het mis.

Waarom datasheets hier zwaarder wegen dan webpagina's

Een productpagina draagt misschien acht tot twintig attributen: behuizing, primaire rating, een lifecycle-vlag, prijs, voorraad. Een datasheet draagt er honderden: absolute maximum ratings, elektrische karakteristieken over temperatuur, timingdiagrammen, pinbeschrijvingen, thermische weerstandswaarden, aanbevolen footprints, moisture sensitivity level, decoders voor het bestelnummer. Vrijwel elke vraag die een engineer daadwerkelijk aan een assistent stelt — kan ik dit op 5,5 V draaien, wat is de ruststroom bij 85 graden, is de pinout compatibel met het onderdeel dat ik vervang — wordt in de datasheet beantwoord en nergens anders.

Dat weegt nu zwaarder dan vroeger, omdat die vragen aan assistenten worden gesteld in plaats van in uw zoekvak getypt. Forrester stelde in januari 2026 vast dat 94% van de zakelijke inkopers inmiddels AI gebruikt tijdens het inkoopproces. En juist de pagina's met de meeste technische diepgang presteren het slechtst: in Adobe's analyse van machineleesbaarheid in de retail van april 2026 scoorden productdetailpagina's 66%, de laagste score van alle paginatypes, onder homepages met 75% en FAQ-pagina's met 80%.

Wanneer de onderliggende data onbereikbaar is, is het gevolg geen stilte — maar een zelfverzekerde fout. OpenAI bouwde Instant Checkout in ChatGPT in maart 2026 af met ongeveer 30 live merchants, en onjuiste productdata was daarvoor een kernreden: OpenAI had retailsites gescrapet voor productinformatie, en voorraad-, verzend- en prijsgegevens klopten regelmatig niet. Dat is exact hetzelfde faalmechanisme als een verkeerde maximumwaarde, alleen met lagere inzet.

De vijf manieren waarop een datasheet onleesbaar wordt

FaalwijzeWat een crawler zietHoe u het herkent
Botmuur403, 429 of een HTML-challengepagina in plaats van een PDFHet content-type van de respons is text/html, niet application/pdf
Scan zonder tekstlaagEen geldige PDF zonder extraheerbare tekstTekstextractie levert 0 tekens op; geen ingesloten fonts
Document alleen in een viewerEen pagina vol JavaScript zonder bestands-URLDe PDF laadt uit een blob of een geauthenticeerde stream
Beleid van een aparte hostEen schone 200 op de productpagina, een blokkade op het documentDe documenthost heeft een eigen robots.txt en WAF
Tijdelijke of afgeschermde URLEen ondertekende link die verloopt, of een formulierdrempelDe link werkt in uw browser en geeft een 403 vanuit curl

De vijfde is het meest zelf toegebracht. Kortlevende signed URL's, “registreer om te downloaden”-drempels en eenmalige tokens zijn allemaal onzichtbare muren: een crawler heeft geen sessie, geen cookies en geen formuliergedrag. En omdat AI-crawlers geen JavaScript uitvoeren, bestaat elke downloadlink die door een script in de DOM wordt geschreven aan hun kant van de lijn eenvoudigweg niet.

Hoe controleer ik of mijn datasheets leesbaar zijn?

Drie commando's geven uitsluitsel. Draai ze op uw eigen documenten.

  1. 01Controleer het ophalen. Geeft de URL een PDF terug aan een gewone client die geen browser is?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"

U wilt uiteindelijk een 200 en content-type: application/pdf. Een content-type: text/html betekent dat u een challenge- of loginpagina kreeg voorgeschoteld, vermomd als download.

  1. 01Download hem en bevestig dat het echt een PDF is.
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdf

De eerste vijf bytes moeten %PDF- zijn. Zijn ze <!DOC, dan hebt u een foutpagina gedownload.

  1. 01Test de tekstlaag. Dit is de test die niemand draait.
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdf

Hoe zie ik of een PDF een tekstlaag heeft?

Twee getallen, en het verschil ertussen is onmiskenbaar. We hebben beide tests gedraaid op een echte, actuele fabrikantendatasheet — de LM358 van Texas Instruments, een PDF van 4,15 MB — en op een gerasterde kopie van datzelfde document, precies zoals een gescande legacy-datasheet er voor een machine uitziet.

TestEchte datasheetScan zonder tekstlaag
Door pdftotext geëxtraheerde tekens95.8950
Regels met ingesloten fonts in pdffonts1140
Voor een mens visueel identiekJaJa
Bruikbaar voor een AI-assistentJaNee

Dat is de hele diagnose. Nul extraheerbare tekens en nul ingesloten fonts betekent dat er geen tekst in het bestand zit — alleen een plaatje van tekst. Het document rendert perfect voor een mens en draagt letterlijk niets bij aan een model. Een gescande datasheet uit de jaren negentig voor een onderdeel dat nog in productie is, is voor elk AI-systeem op internet een blanco pagina.

Twee verfijningen zijn het weten waard. Een laag maar niet-nul aantal tekens — zeg een paar honderd tekens op een document van veertig pagina's — duidt meestal op een gescande body met een tekstkop, en is net zo onbruikbaar. En in de uitvoer van pdffonts doet de kolom uni ertoe: fonts die als subset zijn ingesloten zonder ToUnicode-map kunnen als mojibake worden geëxtraheerd, ook al zijn de tekens technisch gezien aanwezig. Controleer steekproefsgewijs de eerste 200 tekens van de geëxtraheerde tekst in plaats van blind op het aantal te vertrouwen.

Om een hele bibliotheek door te lichten, zet u er een lus omheen:

while read -r url; do
  code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
  chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
  echo "$code $chars $url"
done < datasheet-urls.txt

Sorteer de uitvoer oplopend op aantal tekens. Alles bovenaan die lijst is een gat in uw productdata.

De valkuil van de aparte host

Deze treft grote organisaties bijna zonder uitzondering, juist omdat hij het gevolg is van dingen netjes doen. Documenten verhuizen naar een DAM, een documentatie-subdomein of een CDN, en elk daarvan is een aparte origin met een eigen configuratie — en vaak een eigen eigenaar.

Onder RFC 9309 geldt robots.txt per origin: schema, host en poort. https://www.example.com/robots.txt regelt niets op https://docs.example.com/ en niets op https://cdn.example-media.net/. Verwelkomt uw hoofdsite AI-crawlers terwijl uw documenthost vanuit een standaardtemplate is opgezet met een generieke Disallow: /, of achter een botmanager zit die alles wat niet menselijk is een challenge voorschotelt, dan ligt uw hele technische bibliotheek in het donker terwijl uw marketingsite wagenwijd openstaat.

Controleer elke origin die een document serveert:

for h in www.example.com docs.example.com cdn.example-media.net; do
  echo "--- $h"
  curl -sS --max-time 15 "https://$h/robots.txt" | head -30
done

Hoe het eruitziet als het goed is

Een correct gepubliceerde datasheet is onopvallend, en dat is precies de bedoeling. Texas Instruments serveert de LM358-datasheet op een stabiele, raadbare URL onder /lit/ds/; de robots.txt legt geen enkele beperking op dat pad; het bestand geeft 200 terug met content-type: application/pdf aan een client zonder browser die zich als GPTBot identificeert; en de PDF heeft een volledige tekstlaag met ingesloten, Unicode-gemapte fonts. Geen login, geen viewer, geen signed URL, geen tussenpagina. Elke extractiepijplijn ter wereld kan hem lezen.

De beweging in de componentenindustrie gaat richting nog eenvoudiger. Microchip publiceerde in november 2025 een gratis MCP-server zonder authenticatie voor zijn productdata — specificaties, datasheets, voorraad, prijzen en levertijden — en TrustedParts van ECIA lanceerde in juni 2026 een AI-agentdienst voor voorraad die de beschikbaarheid bij geautoriseerde distributeurs ontsluit voor Copilot, ChatGPT en Claude. Beide berusten op hetzelfde inzicht: een document waar een machine voor moet vechten, is een document dat verliest.

Hoe lost u het op?

Op volgorde van rendement per inspanning:

  1. 01Deblokkeer de documentpaden. Sta AI-crawlers toe op /datasheets/*, /lit/*, /documents/* en vergelijkbare paden, in de WAF én in robots.txt. Dat zijn twee losse schakelaars en beide moeten om.
  2. 02Haal downloaddrempels weg bij openbare technische documenten. Staat een datasheet op uw publieke site, dan is hij al openbaar. Een registratieformulier houdt alleen de machines tegen die u zouden hebben aanbevolen.
  3. 03Zet elke PDF zonder tekstlaag door de OCR en publiceer hem opnieuw mét tekstlaag. Prioriteer op omzet per onderdeel, niet op ouderdom van het document. Moderne OCR op een schone scan van 300 dpi is op bodytekst vrijwel verliesvrij; controleer de parametertabellen met de hand.
  4. 04Geef elk document een stabiele, directe, linkbare URL. Geen blobs, geen viewers, geen verlopende tokens, geen ?token=-querystrings.
  5. 05Publiceer van elke datasheet een HTML- of markdown-tweeling. Specificatietabellen als echte tabellen. Dit is de meest effectieve verandering, omdat ze elke afhankelijkheid van PDF-layoutheuristiek wegneemt en u een pagina oplevert die u bovendien op juistheid kunt monitoren.
  6. 06Verwijs vanaf de productpagina naar het document in server-gerenderde HTML, zodat een crawler die de pagina bereikt ook het document bereikt zonder iets uit te voeren.
  7. 07Ontsluit de geëxtraheerde parameters als gestructureerde data — JSON-LD op de pagina, en het liefst een bevraagbaar endpoint — zodat een agent erop kan filteren in plaats van telkens opnieuw een PDF te parsen.

Partsgraph heeft in augustus 2026 wereldwijd 984 domeinen van distributeurs en fabrikanten geaudit, in Noord-Amerika, Europa en Azië. De mediane AI-zichtbaarheidsscore was 50 van de 100, en 70% van de groep kreeg een D of een F. De documentlaag was steevast het zwakste onderdeel van de score: 38% kon geen enkele leesbare cataloguspagina serveren aan een standaardclient zonder browser, en de toegang tot documenten faalde vaker dan de toegang tot pagina's.

Het ongemakkelijke is dat niets hiervan in uw analytics opduikt. Een geblokkeerde crawler dient geen bugmelding in, een slechte OCR gooit geen exception, en een model dat uw datasheet niet kan lezen, vertelt de koper niet dat het uw datasheet niet kon lezen. Het beveelt gewoon een concurrent aan van wie de PDF wél openging.

U kunt uw eigen documentbibliotheek langs deze tests leggen met de gratis AI-zichtbaarheidsgrader van Partsgraph op [/audit](/audit).

Veelgestelde vragen

Kunnen AI-crawlers überhaupt PDF's lezen?

Ophalen kunnen ze ze, en PDF-tekstextractie is een standaardonderdeel van ingestiepijplijnen. Wat ze niet kunnen, is tekst verzinnen die niet in het bestand staat. Extractie leest de tekstlaag; is de PDF een gescande afbeelding zonder tekstlaag, dan levert extractie niets op en draagt het document niets bij.

Hoe zie ik of een PDF een tekstlaag heeft?

Draai pdftotext op het bestand en tel de tekens die het teruggeeft, draai daarna pdffonts en tel de regels. Een gezonde datasheet levert tienduizenden tekens op en een lange lijst ingesloten fonts. Een scan zonder tekstlaag levert nul tekens en nul fonts op.

Mijn datasheets staan op een apart documentatie-subdomein. Maakt dat uit?

Ja. Onder RFC 9309 geldt robots.txt per origin — schema, host en poort. Een permissieve robots.txt op www.example.com verleent niets op docs.example.com of op uw CDN-hostnaam. Elke origin die documenten serveert, heeft een eigen beleid nodig, en op elke origin gelden bovendien afzonderlijk uw WAF-regels.

Moet ik de inhoud van de datasheet als HTML op de webpagina zetten?

Ja, en meestal is dat de ingreep met het hoogste rendement. Een HTML- of markdown-tweeling van elke datasheet — specificatietabellen, absolute maximum ratings, pinbeschrijvingen, bestelinformatie — is triviaal te parsen, te cachen en te citeren, en neemt elke afhankelijkheid weg van hoe goed een PDF-extractor met uw opmaak omgaat.

Beschermt het blokkeren van bots op mijn documenthost mijn intellectueel eigendom?

Het beschermt u vooral tegen aanbevolen worden. Datasheets worden al door aggregators gespiegeld, dus het blokkeren van de crawler haalt de inhoud zelden uit het trainingscorpus; het betekent alleen dat het model een verouderde kopie van een derde partij ziet in plaats van uw actuele revisie. Gaat het u om controle, serveer dan het gezaghebbende document en bewaak de juistheid ervan.

Overleven meerkoloms opmaak en tabellen de extractie?

Niet foutloos. Datasheets met twee kolommen raken bij lineaire extractie vaak door elkaar, en parametertabellen met samengevoegde cellen verliezen hun rijstructuur. Getagde PDF's met een correcte leesvolgorde helpen aanzienlijk, maar een HTML- of markdown-kopie van dezelfde tabellen neemt de dubbelzinnigheid volledig weg.

Hoeveel datasheets moet ik testen?

Test eerst uw top 20 op verkeer en trek daarna met een script door de hele bibliotheek. Onze ervaring is dat de fouten clusteren per jaargang en per authoringtool, dus een steekproef die alleen recente onderdelen bevat, ziet er veel gezonder uit dan de bibliotheek in werkelijkheid is.

Bronnen

  1. 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
  2. 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
  3. 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
  4. 04Forrester, The State Of Business Buying, 2026 (January 2026)
  5. 05Vercel and MERJ, The rise of the AI crawler, December 2024
  6. 06RFC 9309, Robots Exclusion Protocol
  7. 07Microchip Technology, MCP Server press release, November 2025
  8. 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
  9. 09Texas Instruments, LM358 datasheet (used as a worked example)
Test het op uw eigen catalogus

Zie precies wat AI-assistenten vandaag wel en niet van uw producten kunnen lezen — crawlerbeleid, catalogusdekking, toegang tot datasheets — beoordeeld en vergeleken met 984 distributeurs en fabrikanten wereldwijd.

Beoordeel mijn catalogus

Gerelateerde veldnotities