# Das agentische Web und industrielle Produktdaten

> Das Web teilt sich in eine menschliche und eine maschinelle Ebene: Crawl-to-Refer-Ökonomie, Cloudflares Mautschranken, signierte Agenten – und was zu tun ist.

**Language:** de  
**Published:** 2026-08-09  
**Category:** Market · **Tags:** agentic web, crawlers, Cloudflare, Web Bot Auth, llms.txt, product data  
**Canonical:** https://partsgraph.ai/de/blog/the-agentic-web-and-industrial-data

## Kurz gefasst

**Wie verändert das agentische Web, was Industriehersteller veröffentlichen müssen?**

Das Web trennt sich in eine menschliche Ebene, die für Browser optimiert ist, und eine maschinelle Ebene, die für Agenten optimiert ist – und beide werden inzwischen unterschiedlich reguliert. Automatisierter Traffic übersteigt den menschlichen bereits: Imperva hat 2025 53 % des Web-Traffics als automatisiert gemessen. Und die Infrastrukturanbieter fangen an, ihn abzurechnen: Ab dem 15. September 2026 blockiert Cloudflare auf werbeführenden Seiten neuer und kostenloser Accounts standardmäßig KI-Trainings- und Agenten-Crawler; als Alternativen zum pauschalen Blockieren zeichnen sich Pay-per-Crawl und kryptografisch signierte Agentenidentitäten ab. Für einen Hersteller heißt das praktisch: Crawlbar zu sein ist nicht mehr dasselbe wie erreichbar zu sein – und wer zuerst korrekt und erreichbar ist, wird zur Standardantwort.

---

## Das Web hat jetzt zwei Zielgruppen – und nur eine davon hat Augen

Dreißig Jahre lang hieß Veröffentlichen im Web: Veröffentlichen für einen Menschen mit einer Maus in der Hand. Alles, was daraus folgte – Layout, JavaScript-Frameworks, Cookie-Banner, Analytics, Werbeflächen –, setzte einen Menschen am anderen Ende voraus.

> **Figure.** How a canonical parts graph sits between existing systems and agent-facing surfaces.

Diese Annahme ist heute häufiger falsch als richtig. Der Bad Bot Report 2026 von Imperva hat ergeben, dass automatisierter Traffic 2025 für 53 % des gesamten Web-Traffics stand, nach 51 % im Jahr zuvor, während der menschliche Anteil auf 47 % gesunken ist – Tendenz weiter fallend. Cloudflare hat bei der Ankündigung seiner Crawler-Richtlinie 2026 dieselbe Beobachtung gemacht: Der überwiegende Teil des Internet-Traffics ist nicht menschlich.

Die interessante Konsequenz ist nicht das Verhältnis. Sie liegt darin, dass die beiden Zielgruppen inzwischen *getrennt reguliert werden* – andere Zugriffsregeln, andere Preise, andere Identitätsanforderungen. Das Web spaltet sich in eine menschliche und eine maschinelle Ebene, und Industriehersteller haben über die zweite bislang keinen Gedanken verschwendet.

## Warum ist die Ökonomie gekippt?

Suche funktionierte, weil sie ein Tauschgeschäft war. Ein Crawler nahm Ihre Seite und lieferte Besucher zurück. Verlage haben sich darauf eingelassen, weil der Wechselkurs günstig war.

Die KI-gestützte Recherche hat diesen Wechselkurs zerstört. Cloudflare veröffentlicht seit 2025 auf Radar Crawl-to-Refer-Verhältnisse – gecrawlte Seiten je gesendetem Verweis – und die Zahlen liegen weit außerhalb der klassischen Suchnorm von zwei oder weniger Crawls pro Besucher. In einer Stichprobe von Ende Juni 2025 lag der Crawler von Anthropic bei rund 70.900 gecrawlten Seiten pro Verweis. Cloudflare hat 2026 zudem berichtet, dass mehr als die Hälfte des KI-Crawl-Traffics darauf entfällt, unveränderte Seiten erneut abzurufen.

Parallel dazu ist die menschliche Seite des Tauschgeschäfts unabhängig davon dünner geworden. SparkToro hat Anfang 2026 gemessen, dass 68 % der US-Google-Suchen ohne Klick enden und nur noch rund 276 von 1.000 Suchen einen Klick ins offene Web abgeben – 2024 waren es 374.

Verlage sahen sich also steigender Entnahme und sinkender Gegenleistung gegenüber – und taten das Naheliegende.

**Beachten Sie dabei genau: Diese Logik gilt nur für Unternehmen, deren Inhalt das Produkt ist.** Das Datenblatt eines Herstellers wird nicht über Seitenaufrufe monetarisiert. Es ist Marketingmaterial für eine physische Sache, die Sie mit Marge verkaufen. Wenn ein Assistent Ihren gesamten Katalog 70.000-mal liest und Ihnen einen einzigen Ingenieur schickt, der Ihr Teil in ein Programm über 500.000 Stück hineinspezifiziert, haben Sie gewonnen. Die Crawl-to-Refer-Klage der Verlage, ungeprüft in einen industriellen Kontext übertragen, führt exakt zur falschen Richtlinie.

## Was die Mautschranken tatsächlich bewirken

| Mechanismus | Worum es geht | Status | Relevanz für einen Hersteller |
| --- | --- | --- | --- |
| Zweckbasierte Kategorisierung | Cloudflare teilt KI-Traffic in Search, Agent und Training auf, jeweils separat steuerbar | Live; neue Voreinstellungen ab 15. September 2026 | Hoch – Sie sollten Ihre Richtlinie je Kategorie selbst festlegen, statt eine zu erben |
| Standardmäßiges Blockieren auf Werbeseiten | Training- und Agent-Crawler werden auf werbeführenden Seiten standardmäßig blockiert; Crawler mit gemischtem Zweck dort vollständig | Ab 15. September 2026, für Neukunden, neue Sites und bestehende Sites der kostenlosen Tarifstufe | Indirekt – Ihr Katalog trägt kaum Werbung, die Fachpresse über Ihre Teile aber schon |
| Pay-per-Crawl | HTTP-402-Antworten mit Preisangabe, dazu die Header `crawler-max-price`, `crawler-exact-price` und `crawler-charged`, abgerechnet an der Edge | Private Beta | Heute gering; ein Signal, wohin die Abrechnung steuert |
| Web Bot Auth / signierte Agenten | Kryptografische Agentenidentität über HTTP Message Signatures und einen `Signature-Agent`-Header, anstelle von User-Agent-Strings | Von Cloudflare im August 2025 ausgeliefert; in Arbeit bei der IETF | **Hoch** – die Voraussetzung dafür, einem bekannten Agenten berechtigungsgebundene Daten auszuliefern |

Die letzte Zeile ist kommerziell die entscheidende – und genau die, über die in der Industriebelieferung niemand spricht.

Alles, worüber ein Industriezulieferer tatsächlich verkauft – Vertragspreise, reservierte Bestände, kundenspezifische Lieferzeiten, Listen freigegebener Alternativteile –, sind Daten, die Sie nicht offen veröffentlichen können. Heute heißt das: Agenten bekommen den öffentlichen Listenpreis und eine generische Verfügbarkeitsangabe, also etwas Falsches. Überprüfbare Agentenidentität macht aus „das können wir nicht offenlegen“ ein „das können wir *diesem* Agenten offenlegen, der für *diesen* Kunden handelt – und wir protokollieren es“. Das ist keine Geschichte über das Blockieren von Crawlern. Es ist eine Geschichte über Kanalerschließung, die zufällig über dieselben Leitungen läuft.

## Die Lektion llms.txt

Es lohnt sich, bei llms.txt zu verweilen, denn sie ist das perfekte Beispiel dafür, wie dieser Markt Aufwand fehlleitet.

Der Vorschlag war vernünftig: eine reine Textdatei, die KI-Systemen sagt, wo Ihre guten Inhalte liegen. Sie wurde breit übernommen. Sie wurde in jedem Marketing-Newsletter besprochen. Dann hat Ahrefs 137.210 Domains analysiert und festgestellt, dass **97 % der veröffentlichten llms.txt-Dateien im Mai 2026 null Anfragen erhalten haben**. Die wenigen Abrufe, die stattfanden, kamen überwiegend von SEO-Audit-Tools statt von KI-Systemen, und die Studie fand keinerlei Hinweise auf einen Zuwachs an Zitierungen in ChatGPT, Perplexity oder AI Overviews.

Derselbe Datensatz zeigte zugleich, dass KI-Bots 19,5 % aller Anfragen ausmachten, wobei agentische Infrastruktur mit 10,5 % die größte KI-Kategorie war. Die Maschinen waren also sehr wohl da. Sie haben nur Ihre echten Seiten abgerufen – jene Seiten, die viele Hersteller clientseitig rendern und deshalb leer ausliefern.

Die Lektion reicht über eine einzelne Datei hinaus. **Die Übernahme einer Konvention ist nicht dasselbe wie ihre Nutzung.** Der verlässliche Test ist nicht, ob ein Standard in der Debatte Fahrt aufnimmt, sondern ob echte Clients ihn abrufen. Zwei Dinge bestehen diesen Test derzeit: serverseitig gerendertes HTML und Endpunkte nach dem Model Context Protocol – MCP hat bis März 2026 rund 97 Millionen monatliche SDK-Downloads erreicht und ist im Dezember 2025 unter die neutrale Governance der Agentic AI Foundation der Linux Foundation gewechselt, mit AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft und OpenAI als Platin-Mitgliedern.

## Die regulatorische Strömung läuft in dieselbe Richtung

Es gibt eine zweite Kraft, die Industriedaten in maschinenlesbare Form drängt – und sie hat mit KI nichts zu tun.

Die am 16. Juli 2026 angenommene Durchführungsverordnung (EU) 2026/1778 der Kommission legt die praktischen Modalitäten für das Register der digitalen Produktpässe fest, das mit der Ökodesign-Verordnung für nachhaltige Produkte eingerichtet wurde – Struktur, Identitätsprüfung, Registrierung, Registrierungsnachweis, Protokollierung und Aufbewahrung. Wenige Tage später hat die Kommission das Register gestartet. Bauprodukte laufen auf einer eigenen Spur unter der überarbeiteten Bauprodukteverordnung, mit einem längeren Zeitplan.

Streicht man die Compliance-Sprache, bleibt die Anforderung: strukturierte, maschinenlesbare Produktdaten mit verifizierter Identität und Herkunft, abrufbar durch Dritte. Das ist beinahe wörtlich die Beschreibung eines agentenfähigen Katalogs. Jeder Hersteller, der DPP-Compliance und KI-Lesbarkeit als zwei voneinander unabhängige Programme mit zwei Budgets behandelt, baut dasselbe Asset zweimal.

## Was ein Hersteller konkret tun sollte

1. **Prüfen Sie, was eine Maschine sieht.** Rufen Sie Ihre eigenen Katalogseiten mit einem einfachen Client ohne Browser ab. Als Partsgraph im August 2026 weltweit 984 Distributoren- und Herstellerdomains geprüft hat, lieferten 38 % einem gewöhnlichen Nicht-Browser-Client keine lesbare Katalogseite, und der Median des KI-Sichtbarkeitswerts lag bei 50 von 100. Clientseitiges Rendering ist der übliche Verursacher – und in jeder normalen Analytics-Ansicht unsichtbar.
2. **Formulieren Sie eine ausdrückliche Crawler-Richtlinie und veröffentlichen Sie sie.** Entscheiden Sie je Kategorie, was Sie erlauben: Suchindexierung, Abruf für Antworten, Agentenzugriff, Training. In derselben Prüfung haben nur 19 % der 984 Domains eine ausdrückliche KI-Crawler-Richtlinie veröffentlicht, die die großen Bots namentlich nennt – vier von fünf laufen also mit der Voreinstellung, die ihr CDN-Anbieter für sie wählt, und je strenger die Voreinstellungen an der Edge werden, desto mehr bedeutet Schweigen „nein“.
3. **Prüfen Sie Ihre CDN-Voreinstellungen vor dem 15. September 2026.** Wenn Sie auf einer kostenlosen Tarifstufe sind oder neue Properties aufsetzen, ändern sich die Voreinstellungen unter Ihnen weg. Das ist eine Zehn-Minuten-Aufgabe, die niemand im Kalender stehen hat.
4. **Blockieren Sie nicht pauschal.** Wer die Blockadehaltung eines Verlags kopiert, optimiert auf Erlöse, die er gar nicht erzielt, und verschenkt Distribution, die er wirklich braucht.
5. **Liefern Sie stabile Daten statisch aus und volatile Daten live.** Parametrik, Compliance-Status und Lebenszyklus lassen sich serverseitig rendern und strukturieren. Bestand, Lieferzeit und Vertragspreis lassen sich in keiner Aktualisierungsfrequenz korrekt crawlen und gehören hinter einen abfragbaren Endpunkt.
6. **Bereiten Sie sich auf Identität vor, nicht nur auf Zugriff.** Signierte Agenten werden berechtigungsabhängige Antworten möglich machen. Zulieferer, die ihre Preis- und Verfügbarkeitsdaten bereits normalisiert haben, werden das nutzen können; alle anderen werden dieses Zeitfenster mit Datenbereinigung verbringen.
7. **Überwachen Sie Korrektheit, nicht nur Sichtbarkeit.** Eine selbstbewusst falsche Lieferzeit richtet kommerziell mehr Schaden an als eine fehlende – und keine von beiden taucht in einem Ranking-Report auf.

## Warum Erster zu sein hier mehr zählt als sonst

Es gibt einen sehr konkreten Grund, früh zu handeln, und es ist nicht das übliche Landnahme-Argument.

Assistenten konvergieren. Findet ein Modell eine Quelle, die eine ganze Klasse von Fragen korrekt und günstig beantwortet – eine, die sich eindeutig parsen lässt, Artikelnummern konsistent auflöst und sich zwischen den Seiten nicht widerspricht –, dann wird diese Quelle für die gesamte Klasse zum Weg des geringsten Widerstands. Sie wird häufiger abgerufen, häufiger zitiert und in der nächsten Trainingsrunde sowie in den darauf aufsetzenden Retrieval-Indizes weiter verstärkt.

Das ist kein Ranking, das Sie später mit einem größeren Budget zurückkaufen können, denn der Mechanismus ist keine Auktion. Es ist eine Voreinstellung. Und industrielle Voreinstellungen halten sich ungewöhnlich hartnäckig, weil sie über Dokumente weitergetragen werden, die bestehen bleiben: eine Lieferantenfreigabeliste, eine Standardspezifikation, eine Stücklistenvorlage. Ein Teil, das 2026 zur Standardantwort wird, steht 2031 immer noch in der Vorlage.

Die Folgerung ist unbequem für alle, die darauf warten, dass sich das Bild klärt. Der Preis für frühes Handeln ist ein Datenprojekt. Der Preis für spätes Handeln ist nicht dasselbe Datenprojekt zu einem späteren Zeitpunkt – es ist ein späteres Datenprojekt gegen einen Wettbewerber, der bereits die Standardantwort ist.

*Der kostenlose Grader unter [/audit](/audit) zeigt genau, was eine Maschine heute aus Ihrem Katalog liest – und wo die Lücken sind.*

## Häufige Fragen

### Was ändert sich am 15. September 2026?

Cloudflare beginnt, den Traffic von KI-Crawlern in die Kategorien Search, Agent und Training einzuteilen, statt ihn als eine einzige Klasse zu behandeln. Ab diesem Datum werden Training- und Agent-Crawler auf Seiten mit Werbung standardmäßig blockiert; Crawler mit gemischtem Zweck, die ihren Zweck nicht pro Anfrage deklarieren, werden auf diesen Seiten vollständig blockiert. Die Voreinstellungen gelten für Neukunden, für neue Websites bestehender Kunden und für alle bestehenden Sites der kostenlosen Tarifstufe; zahlende Kunden können sie vorab in den Sicherheitseinstellungen überschreiben.

### Betrifft das den Produktkatalog eines Herstellers?

Meist nicht direkt, denn die Voreinstellungen knüpfen an werbeführende Seiten an, und die meisten Herstellerkataloge enthalten keine Werbung. Bedeutsam ist es aus zwei indirekten Gründen. Erstens sind die Fachpublikationen, Distributoreninhalte und technischen Foren, in denen über Ihre Teile gesprochen wird, häufig werbefinanziert – die Berichterstattung Dritter über Ihre Produkte könnte für Assistenten also schlechter verfügbar werden. Zweitens schafft es den Präzedenzfall, dass Crawler-Zugriff eine abgerechnete, zweckgebundene Erlaubnis ist – und dieses Modell wird sich ausbreiten.

### Was ist das Crawl-to-Refer-Verhältnis, und warum ist es wichtig?

Es ist die Zahl der Seiten, die ein KI-Unternehmen crawlt, je Besucher, den es zurückschickt. Cloudflare veröffentlicht diese Verhältnisse seit 2025 auf Radar; in einer Stichprobe von Ende Juni 2025 lag der Crawler von Anthropic bei rund 70.900 gecrawlten Seiten pro Verweis, gegenüber dem klassischen Suchmaschinenwert von zwei oder weniger Crawls je gesendetem Besucher. Dieses Verhältnis ist der Grund, warum Verlage angefangen haben zu blockieren. Für einen Hersteller ist die Umkehrung entscheidend: Sie verkaufen keine Werbung gegen Traffic, ein hohes Crawl-to-Refer-Verhältnis ist für Sie also kein Kostenfaktor – es ist Distribution, für die Sie nichts bezahlen.

### Sollten wir eine llms.txt-Datei veröffentlichen?

Sie kostet fast nichts und bewirkt fast nichts. Ahrefs hat 137.210 Domains analysiert und festgestellt, dass 97 % der veröffentlichten llms.txt-Dateien im Mai 2026 null Anfragen erhalten haben; die wenigen Abrufe, die stattfanden, kamen überwiegend von SEO-Tools statt von KI-Systemen, und ein messbarer Zuwachs an Zitierungen war nicht feststellbar. Veröffentlichen Sie eine, wenn sie nichts kostet – lassen Sie sie aber nie an die Stelle serverseitig gerenderter Seiten, strukturierter Daten, Feeds oder eines Endpunkts treten.

### Was ist Web Bot Auth, und warum sollte das einen Hersteller interessieren?

Es ist ein Verfahren, mit dem ein automatisierter Client seine Identität kryptografisch nachweist – über HTTP Message Signatures, einen Ed25519-Schlüssel je Agent und einen Signature-Agent-Header – statt sich auf einen leicht fälschbaren User-Agent-String zu verlassen. Cloudflare hat signierte Agenten im August 2025 ausgeliefert, in einer ersten Gruppe mit ChatGPT agent und Goose von Block; die Arbeit läuft inzwischen über die IETF. Wichtig ist das, weil es die Voraussetzung dafür ist, unterschiedlichen Agenten unterschiedliche Daten auszuliefern – und genau so gelangen Vertragspreise und kundenspezifische Verfügbarkeiten irgendwann sicher zu Agenten.

### Ist das Blockieren von KI-Crawlern für einen Industriezulieferer eine sinnvolle Grundeinstellung?

Fast nie. Blockieren ergibt Sinn, wenn Ihr Inhalt das Produkt ist und Traffic der Umsatz – bei Verlagen, Medien, Marktforschung. Für einen Hersteller oder Distributor ist der Katalog Marketingmaterial für ein physisches Produkt, und in der Antwort eines Assistenten zu fehlen kostet eine Spezifikation. Die richtige Haltung ist selektiv: den Katalog öffnen, eine ausdrückliche Crawler-Richtlinie veröffentlichen und nur das abrechnen oder authentifizieren, was wirklich kommerziell sensibel ist – etwa Vertragspreise.

### Wie greift die EU-Regulierung hier ein?

Sie wirkt aus einem anderen Motiv in dieselbe Richtung. Die Durchführungsverordnung (EU) 2026/1778 der Kommission vom 16. Juli 2026 hat die Betriebsregeln für das EU-Register der digitalen Produktpässe unter der Ökodesign-Verordnung für nachhaltige Produkte (ESPR) festgelegt; die Kommission hat das Register wenige Tage später gestartet. Bauprodukte werden gesondert über die überarbeitete Bauprodukteverordnung und mit einem späteren Zeitplan behandelt. Die Compliance-Anforderung lautet: strukturierte, maschinenlesbare Produktdaten mit verifizierter Identität und Herkunft – und das ist weitgehend dasselbe Asset, das auch das agentische Web verlangt. Hersteller, die es zweimal aufbauen, einmal für Brüssel und einmal für die Assistenten, verschwenden ihr Budget.

## Quellen

1. [TechCrunch, Cloudflare's new policy pushes AI companies to pay for publishers' content (1 July 2026)](https://techcrunch.com/2026/07/01/cloudflares-new-policy-pushes-ai-companies-to-pay-for-publishers-content/)
2. [Help Net Security, Cloudflare changes AI crawler access rules (2 July 2026)](https://www.helpnetsecurity.com/2026/07/02/cloudflare-ai-crawler-controls/)
3. [Cloudflare, Introducing pay per crawl](https://blog.cloudflare.com/introducing-pay-per-crawl/)
4. [Cloudflare, The crawl before the fall of referrals: crawl-to-refer ratios on Radar](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/)
5. [Cloudflare, The age of agents: cryptographically recognizing agent traffic (28 August 2025)](https://blog.cloudflare.com/signed-agents/)
6. [IETF, HTTP Message Signatures for automated traffic architecture (Web Bot Auth)](https://datatracker.ietf.org/doc/html/draft-meunier-web-bot-auth-architecture)
7. [Ahrefs, We analysed 137,000 sites: 97% of llms.txt files never get read (May 2026)](https://ahrefs.com/blog/llmstxt-study/)
8. [Imperva / Thales, 2026 Bad Bot Report: Bots in the Agentic Age](https://www.imperva.com/blog/bad-bot-report-2026-bots-agentic-age/)
9. [SparkToro, In 2026, Less than One Third of Google Searches Still Send a Click](https://sparktoro.com/blog/in-2026-less-than-one-third-of-google-searches-still-send-a-click/)
10. [Model Context Protocol, MCP joins the Agentic AI Foundation (9 December 2025)](https://blog.modelcontextprotocol.io/posts/2025-12-09-mcp-joins-agentic-ai-foundation/)
11. [EUR-Lex, Commission Implementing Regulation (EU) 2026/1778 on the digital product passport registry (16 July 2026)](https://eur-lex.europa.eu/legal-content/EN/TXT/?uri=OJ%3AL_202601778)

## Other languages

- English: https://partsgraph.ai/blog/the-agentic-web-and-industrial-data/md
- Français: https://partsgraph.ai/fr/blog/the-agentic-web-and-industrial-data/md
- Español: https://partsgraph.ai/es/blog/the-agentic-web-and-industrial-data/md
- Italiano: https://partsgraph.ai/it/blog/the-agentic-web-and-industrial-data/md
- Nederlands: https://partsgraph.ai/nl/blog/the-agentic-web-and-industrial-data/md
- Polski: https://partsgraph.ai/pl/blog/the-agentic-web-and-industrial-data/md
- Português: https://partsgraph.ai/pt/blog/the-agentic-web-and-industrial-data/md
- Svenska: https://partsgraph.ai/sv/blog/the-agentic-web-and-industrial-data/md
- Türkçe: https://partsgraph.ai/tr/blog/the-agentic-web-and-industrial-data/md
- 日本語: https://partsgraph.ai/ja/blog/the-agentic-web-and-industrial-data/md
- 한국어: https://partsgraph.ai/ko/blog/the-agentic-web-and-industrial-data/md
- 简体中文: https://partsgraph.ai/zh/blog/the-agentic-web-and-industrial-data/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/de/audit
