Warum KI Ihre Datenblätter nicht lesen kann

Veröffentlicht 2026-08-099 Min. Lesezeitdatasheets · PDF · AI crawlers · product data

Kurz gefasst

Warum können KI-Assistenten meine Produktdatenblätter nicht lesen?

Vier Dinge machen Datenblätter für KI unbrauchbar: Das PDF wird durch eine Bot-Sperre oder einen Login blockiert, bevor ein Crawler es überhaupt abrufen kann; die Datei ist ein reiner Bildscan ohne Textebene, sodass die Extraktion null Zeichen liefert; das Dokument steckt in einem JavaScript-Viewer ohne direkte Datei-URL; oder es liegt auf einem separaten Dokumentations-Host, dessen robots.txt es untersagt. Jeder dieser Punkte genügt für sich, um die maßgebliche Spezifikation Ihres Bauteils unerreichbar zu machen – und im Datenblatt steht die Spezifikation tatsächlich, die Webseite trägt immer nur eine Zusammenfassung.

Die kurze Antwort

Ein Datenblatt wird auf vier Arten für KI unsichtbar, und alle vier sind banal. Die Datei wird blockiert, bevor sie überhaupt abgerufen wird – durch eine Bot-Regel, einen Login oder eine Zwischenseite. Die Datei ist ein gescanntes Bild ohne Textebene, sodass ein Extraktor null Zeichen herausholt. Das Dokument ist nur über einen JavaScript-Viewer ohne direkte URL erreichbar. Oder das PDF liegt auf einem separaten Dokumentations-Host – docs., media., ein DAM, ein CDN –, dessen eigene robots.txt oder WAF Nein sagt, so großzügig Ihre Hauptsite auch eingestellt sein mag.

None of these are exotic, all four are common, and any one of them is sufficient on its own. The datasheet is the specification of record — when AI can read the product page but not the source, it answers engineering questions from the summary.

Nichts davon ist exotisch. Alle vier Fälle sind verbreitet, und jeder einzelne genügt für sich. Die Konsequenz sollte man klar aussprechen:

Das Datenblatt ist die maßgebliche Spezifikation. Die Produktseite ist nur deren Zusammenfassung. Wenn eine KI die Zusammenfassung lesen kann, die Quelle aber nicht, beantwortet sie technische Fragen aus der Zusammenfassung – und beantwortet sie falsch.

Warum hier Datenblätter wichtiger sind als Webseiten

Eine Produktseite trägt vielleicht acht bis zwanzig Attribute: Gehäuse, wichtigster Kennwert, ein Lifecycle-Kennzeichen, Preis, Lagerbestand. Ein Datenblatt trägt Hunderte: absolute Grenzwerte, elektrische Kennwerte über den Temperaturbereich, Timing-Diagramme, Pinbeschreibungen, Wärmewiderstandswerte, empfohlene Footprints, Feuchtigkeitsempfindlichkeitsklasse, Schlüssel zur Entzifferung der Bestellnummer. Nahezu jede Frage, die ein Entwickler einem Assistenten tatsächlich stellt – Kann ich das mit 5,5 V betreiben, Wie hoch ist der Ruhestrom bei 85 Grad, Ist das Pinout kompatibel mit dem Bauteil, das ich ersetze –, wird im Datenblatt beantwortet und sonst nirgends.

Das wiegt heute schwerer als früher, denn die Fragen werden Assistenten gestellt und nicht mehr in Ihr Suchfeld getippt. Forrester stellte im Januar 2026 fest, dass 94 % der Geschäftskunden inzwischen KI in ihrem Beschaffungsprozess einsetzen. Und ausgerechnet die Seiten mit der größten technischen Tiefe schneiden am schlechtesten ab: Adobes Analyse der Maschinenlesbarkeit im Handel vom April 2026 bewertete Produktdetailseiten mit 66 % – dem niedrigsten Wert aller Seitentypen, unter Startseiten mit 75 % und FAQ-Seiten mit 80 %.

Wenn die zugrunde liegenden Daten nicht erreichbar sind, ist die Folge kein Schweigen – sondern ein selbstbewusst vorgetragener Irrtum. OpenAI fuhr Instant Checkout in ChatGPT im März 2026 mit rund 30 angebundenen Händlern zurück, und ungenaue Produktdaten waren ein wesentlicher Grund dafür: OpenAI hatte Handelsseiten nach Produktinformationen abgegrast, und Bestands-, Versand- und Preisdaten waren häufig falsch. Das ist derselbe Fehlermodus wie ein falscher Grenzwert – nur mit geringerem Risiko.

Die fünf Wege, auf denen ein Datenblatt unlesbar wird

FehlerbildWas ein Crawler siehtWoran Sie es erkennen
Bot-Sperre403, 429 oder eine HTML-Challenge-Seite statt eines PDFDer content-type der Antwort lautet text/html, nicht application/pdf
Reiner BildscanEin gültiges PDF ohne extrahierbaren TextDie Textextraktion liefert 0 Zeichen; keine eingebetteten Schriften
Nur im Viewer verfügbares DokumentEine Seite voller JavaScript ohne Datei-URLDas PDF lädt aus einem Blob oder einem authentifizierten Stream
Eigene Richtlinie eines separaten HostsSauberes 200 auf der Produktseite, Blockade beim DokumentDer Dokumenten-Host hat eine eigene robots.txt und eine eigene WAF
Kurzlebige oder gesperrte URLEin signierter Link, der abläuft, oder eine FormularschrankeDer Link funktioniert in Ihrem Browser und liefert per curl ein 403

Der fünfte Fall ist der am stärksten selbst verschuldete. Kurzlebige signierte URLs, „Zum Download registrieren“-Schranken und Einmal-Token sind allesamt unsichtbare Mauern: Ein Crawler hat keine Session, keine Cookies und füllt keine Formulare aus. Und weil KI-Crawler kein JavaScript ausführen, existiert jeder Download-Link, den ein Skript erst in das DOM schreibt, von ihrer Seite der Leitung aus schlicht nicht.

Wie prüfe ich, ob meine Datenblätter lesbar sind?

Drei Befehle klären das. Führen Sie sie gegen Ihre eigenen Dokumente aus.

  1. 01Prüfen Sie den Abruf. Liefert die URL einem einfachen Client ohne Browser ein PDF?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"

Sie wollen am Ende ein 200 und content-type: application/pdf sehen. Ein content-type: text/html bedeutet, dass Ihnen eine Challenge- oder Login-Seite im Gewand eines Downloads untergeschoben wurde.

  1. 01Laden Sie die Datei herunter und bestätigen Sie, dass es wirklich ein PDF ist.
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdf

Die ersten fünf Bytes müssen %PDF- lauten. Lauten sie <!DOC, haben Sie eine Fehlerseite heruntergeladen.

  1. 01Testen Sie die Textebene. Das ist der Test, den niemand ausführt.
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdf

Woran erkenne ich, ob ein PDF eine Textebene hat?

An zwei Zahlen – und der Abstand zwischen ihnen ist unverkennbar. Wir haben beide Tests gegen ein echtes, aktuelles Herstellerdatenblatt laufen lassen – das LM358 von Texas Instruments, ein PDF mit 4,15 MB – und gegen eine gerasterte Kopie desselben Dokuments, also genau das, was ein eingescanntes Altdatenblatt für eine Maschine ist.

TestEchtes DatenblattReiner Bildscan
Von pdftotext extrahierte Zeichen95.8950
Von pdffonts gemeldete eingebettete Schriften1140
Für einen Menschen optisch identischJaJa
Für einen KI-Assistenten nutzbarJaNein

Mehr Diagnose braucht es nicht. Null extrahierbare Zeichen und null eingebettete Schriften bedeuten, dass in der Datei kein Text steht – nur ein Bild von Text. Das Dokument wird für einen Menschen einwandfrei dargestellt und trägt für ein Modell buchstäblich nichts bei. Ein eingescanntes Datenblatt aus den 1990er-Jahren zu einem Bauteil, das noch in Produktion ist, ist für jedes KI-System im Internet eine leere Seite.

Zwei Feinheiten sollten Sie kennen. Eine niedrige, aber von null verschiedene Zeichenzahl – etwa ein paar Hundert Zeichen auf einem vierzigseitigen Dokument – bedeutet in der Regel einen gescannten Fließtext mit einem Textkopf und ist ebenso unbrauchbar. Und in der Ausgabe von pdffonts zählt die Spalte uni: Schriften, die ohne ToUnicode-Zuordnung als Subset eingebettet sind, können als Zeichensalat extrahiert werden, obwohl technisch gesehen Zeichen vorhanden sind. Prüfen Sie stichprobenartig die ersten 200 Zeichen des extrahierten Textes, statt allein der Zahl zu vertrauen.

Um eine ganze Bibliothek zu durchleuchten, setzen Sie eine Schleife darum:

while read -r url; do
  code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
  chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
  echo "$code $chars $url"
done < datasheet-urls.txt

Sortieren Sie die Ausgabe aufsteigend nach Zeichenzahl. Alles am Anfang dieser Liste ist ein Loch in Ihren Produktdaten.

Die Falle des separaten Hosts

Diese Falle erwischt große Organisationen nahezu ausnahmslos, denn sie ist die Folge davon, dass man es richtig gemacht hat. Dokumente wandern in ein DAM, auf eine Dokumentations-Subdomain oder ein CDN – jeweils eine eigene Origin mit eigener Konfiguration und oft auch mit einem eigenen Verantwortlichen.

Nach RFC 9309 gilt eine robots.txt jeweils nur für eine einzige Origin: Schema, Host und Port. https://www.example.com/robots.txt regelt nichts unter https://docs.example.com/ und nichts unter https://cdn.example-media.net/. Wenn Ihre Hauptsite KI-Crawler willkommen heißt, Ihr Dokumenten-Host aber aus einer Standardvorlage mit pauschalem Disallow: / aufgesetzt wurde oder hinter einem Bot-Manager liegt, der alles Nicht-Menschliche mit einer Challenge abweist, dann liegt Ihre gesamte technische Bibliothek im Dunkeln, während Ihre Marketing-Site weit offen steht.

Prüfen Sie jede Origin, die ein Dokument ausliefert:

for h in www.example.com docs.example.com cdn.example-media.net; do
  echo "--- $h"
  curl -sS --max-time 15 "https://$h/robots.txt" | head -30
done

Wie es aussieht, wenn es richtig gemacht ist

Ein korrekt veröffentlichtes Datenblatt ist unspektakulär – und genau das ist der Punkt. Texas Instruments liefert das LM358-Datenblatt unter einer stabilen, erratbaren URL unterhalb von /lit/ds/ aus; die robots.txt schränkt diesen Pfad nicht ein; die Datei antwortet einem Client ohne Browser, der sich als GPTBot ausweist, mit 200 und content-type: application/pdf; und das PDF trägt eine vollständige Textebene mit eingebetteten, Unicode-zugeordneten Schriften. Kein Login, kein Viewer, keine signierte URL, keine Zwischenseite. Jede Extraktions-Pipeline der Welt kann es lesen.

Die Entwicklung in der Bauelementebranche geht dahin, das noch weiter zu erleichtern. Microchip veröffentlichte im November 2025 einen kostenlosen MCP-Server ohne Authentifizierung für seine Produktdaten – Spezifikationen, Datenblätter, Lagerbestände, Preise und Lieferzeiten –, und TrustedParts von der ECIA startete im Juni 2026 einen KI-Agentendienst für Lagerbestände, der die Verfügbarkeit bei autorisierten Distributoren für Copilot, ChatGPT und Claude zugänglich macht. Beides beruht auf derselben Einsicht: Ein Dokument, um das eine Maschine kämpfen muss, ist ein Dokument, das verliert.

Wie behebt man das?

Nach Ertrag pro Aufwand geordnet:

  1. 01Geben Sie die Dokumentpfade frei. Erlauben Sie KI-Crawlern /datasheets/*, /lit/*, /documents/* und Entsprechendes – in der WAF ebenso wie in der robots.txt. Das sind zwei getrennte Schalter, und beide müssen umgelegt sein.
  2. 02Entfernen Sie Download-Schranken von öffentlichen technischen Dokumenten. Liegt ein Datenblatt auf Ihrer öffentlichen Site, ist es bereits öffentlich. Ein Registrierungsformular hält nur die Maschinen auf, die Sie empfohlen hätten.
  3. 03Führen Sie für jedes reine Bild-PDF eine OCR durch und veröffentlichen Sie es mit Textebene neu. Priorisieren Sie nach dem Umsatz des Bauteils, nicht nach dem Alter des Dokuments. Moderne OCR arbeitet bei einem sauberen Scan mit 300 dpi im Fließtext nahezu verlustfrei; die Parametertabellen sollten Sie von Hand prüfen.
  4. 04Geben Sie jedem Dokument eine stabile, direkte, verlinkbare URL. Keine Blobs, keine Viewer, keine ablaufenden Token, keine ?token=-Querystrings.
  5. 05Veröffentlichen Sie zu jedem Datenblatt einen HTML- oder Markdown-Zwilling. Spezifikationstabellen als echte Tabellen. Das ist die wirksamste Einzelmaßnahme, denn sie beseitigt jede Abhängigkeit von PDF-Layout-Heuristiken und gibt Ihnen eine Seite, deren Richtigkeit Sie zudem überwachen können.
  6. 06Verlinken Sie das Dokument von der Produktseite aus in serverseitig gerendertem HTML, damit ein Crawler, der die Seite erreicht, auch das Dokument erreicht, ohne irgendetwas ausführen zu müssen.
  7. 07Stellen Sie die extrahierten Parameter als strukturierte Daten bereit – JSON-LD auf der Seite und idealerweise einen abfragbaren Endpunkt –, damit ein Agent danach filtern kann, statt jedes Mal erneut ein PDF zu parsen.

Partsgraph hat im August 2026 weltweit 984 Distributoren- und Herstellerdomains in Nordamerika, Europa und Asien geprüft. Der Median der KI-Sichtbarkeitsbewertung lag bei 50 von 100 Punkten, und 70 % der Kohorte erhielten die Note D oder F. Die Dokumentenebene war durchgängig die schwächste Komponente der Bewertung: 38 % konnten einem gewöhnlichen Client ohne Browser nicht eine einzige lesbare Katalogseite ausliefern, und der Zugriff auf Dokumente scheiterte häufiger als der Zugriff auf Seiten.

Das Unangenehme daran ist, dass nichts davon in Ihrer Analytics auftaucht. Ein blockierter Crawler meldet keinen Fehler, eine schlechte OCR wirft keine Exception, und ein Modell, das Ihr Datenblatt nicht lesen kann, sagt dem Einkäufer nicht, dass es Ihr Datenblatt nicht lesen konnte. Es empfiehlt einfach einen Wettbewerber, dessen PDF sich öffnen ließ.

Mit dem kostenlosen KI-Sichtbarkeits-Grader von Partsgraph unter [/audit](/audit) können Sie Ihre eigene Dokumentenbibliothek gegen diese Tests prüfen.

Häufige Fragen

Können KI-Crawler PDFs überhaupt lesen?

Sie können sie abrufen, und die PDF-Textextraktion gehört zum Standard jeder Ingest-Pipeline. Was sie nicht können, ist Text zu erfinden, der nicht in der Datei steht. Die Extraktion liest die Textebene aus; ist das PDF ein gescanntes Bild ohne Textebene, liefert die Extraktion nichts und das Dokument trägt nichts bei.

Woran erkenne ich, ob ein PDF eine Textebene hat?

Lassen Sie pdftotext auf die Datei laufen und zählen Sie die zurückgegebenen Zeichen, führen Sie dann pdffonts aus und zählen Sie die Zeilen. Ein intaktes Datenblatt liefert Zehntausende Zeichen und eine lange Liste eingebetteter Schriften. Ein reiner Bildscan liefert null Zeichen und null Schriften.

Meine Datenblätter liegen auf einer separaten Dokumentations-Subdomain. Spielt das eine Rolle?

Ja. Nach RFC 9309 gilt robots.txt jeweils nur für eine einzige Origin – Schema, Host und Port. Eine großzügige robots.txt auf www.example.com erlaubt nichts auf docs.example.com und nichts auf Ihrem CDN-Hostnamen. Jede Origin, die Dokumente ausliefert, braucht ihre eigene Richtlinie, und jede unterliegt separat Ihren WAF-Regeln.

Sollte ich Datenblattinhalte als HTML auf die Webseite stellen?

Ja, und das ist in der Regel die Maßnahme mit dem höchsten Ertrag. Ein HTML- oder Markdown-Zwilling jedes Datenblatts – Spezifikationstabellen, absolute Grenzwerte, Pinbeschreibungen, Bestellinformationen – lässt sich trivial parsen, cachen und zitieren und beseitigt jede Abhängigkeit davon, wie gut ein PDF-Extraktor mit Ihrem Layout zurechtkommt.

Schützt das Blockieren von Bots auf meinem Dokumenten-Host mein geistiges Eigentum?

Es schützt Sie vor allem davor, empfohlen zu werden. Datenblätter werden ohnehin bei Aggregatoren gespiegelt; den Crawler zu blockieren entfernt die Inhalte deshalb nur selten aus dem Trainingskorpus. Es sorgt lediglich dafür, dass das Modell die veraltete Kopie eines Dritten sieht statt Ihrer aktuellen Revision. Wenn es Ihnen um Kontrolle geht, liefern Sie das maßgebliche Dokument aus und überwachen Sie dessen Richtigkeit.

Überstehen mehrspaltige Layouts und Tabellen die Extraktion?

Nur unvollkommen. Zweispaltige Datenblatt-Layouts verschränken sich bei linearer Extraktion häufig, und Parametertabellen mit verbundenen Zellen verlieren ihre Zeilenstruktur. Getaggte PDFs mit korrekter Lesereihenfolge helfen erheblich, doch ein HTML- oder Markdown-Spiegel derselben Tabellen beseitigt die Mehrdeutigkeit vollständig.

Wie viele Datenblätter sollte ich testen?

Testen Sie zuerst Ihre 20 traffic-stärksten und durchleuchten Sie danach die gesamte Bibliothek per Skript. Nach unserer Erfahrung häufen sich die Fehler nach Jahrgang und nach eingesetztem Autorenwerkzeug – eine Stichprobe, die nur aktuelle Bauteile abdeckt, wirkt daher weit gesünder, als die Bibliothek tatsächlich ist.

Quellen

  1. 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
  2. 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
  3. 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
  4. 04Forrester, The State Of Business Buying, 2026 (January 2026)
  5. 05Vercel and MERJ, The rise of the AI crawler, December 2024
  6. 06RFC 9309, Robots Exclusion Protocol
  7. 07Microchip Technology, MCP Server press release, November 2025
  8. 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
  9. 09Texas Instruments, LM358 datasheet (used as a worked example)
Machen Sie den Test mit Ihrem eigenen Katalog

Sehen Sie genau, was KI-Assistenten heute von Ihren Produkten lesen können und was nicht: Crawler-Richtlinie, Katalogabdeckung, Zugriff auf Datenblätter – bewertet und eingeordnet im Vergleich mit 984 Distributoren und Herstellern weltweit.

Katalog bewerten

Verwandte Feldnotizen