Dlaczego AI nie potrafi odczytać Twoich kart katalogowych
W skrócie
Dlaczego asystenci AI nie potrafią odczytać moich kart katalogowych?
Karty katalogowe psują się dla AI na cztery sposoby: PDF jest zablokowany przez zaporę botów lub logowanie, zanim crawler zdąży go pobrać; plik jest skanem wyłącznie obrazowym bez warstwy tekstowej, więc ekstrakcja zwraca zero znaków; dokument jest uwięziony w podglądzie opartym na JavaScript, bez bezpośredniego URL do pliku; albo leży na osobnym hoście z dokumentacją, którego robots.txt mówi „nie”. Każdy z tych przypadków z osobna sprawia, że rozstrzygająca specyfikacja Twojej części jest nieosiągalna — a specyfikacja mieszka właśnie w karcie katalogowej; strona WWW niesie zawsze tylko jej streszczenie.
Krótka odpowiedź
Karta katalogowa staje się niewidzialna dla AI na jeden z czterech sposobów i wszystkie są całkowicie prozaiczne. Plik zostaje zablokowany, zanim ktokolwiek zdąży go pobrać — przez regułę antybotową, logowanie albo stronę pośrednią. Plik jest zeskanowanym obrazem bez warstwy tekstowej, więc ekstraktor wyciąga z niego zero znaków. Dokument jest osiągalny wyłącznie przez podgląd oparty na JavaScript, bez bezpośredniego URL. Albo PDF leży na osobnym hoście dokumentów — docs., media., systemie DAM, CDN — którego własny robots.txt lub WAF mówi „nie”, niezależnie od tego, jak przyzwalająca jest konfiguracja Twojej głównej witryny.
- Blocked before fetch
- A bot rule, a login or an interstitial. Zero bytes retrieved.
- Scanned image, no text layer
- The extractor pulls out zero characters. The page is there; the words are not.
- JavaScript viewer only
- No direct URL to the file, so nothing to fetch.
- Separate documentation host
- docs., media., a DAM or CDN with its own robots.txt or WAF saying no.
Żaden z tych przypadków nie jest egzotyczny. Wszystkie cztery są powszechne i każdy z osobna wystarczy. Konsekwencję warto wypowiedzieć wprost:
Karta katalogowa jest obowiązującą specyfikacją. Strona produktu jest jej streszczeniem. Kiedy AI potrafi odczytać streszczenie, ale nie źródło, odpowiada na pytania inżynierskie na podstawie streszczenia — i odpowiada błędnie.
Dlaczego to karty katalogowe, a nie strony WWW, mają tu znaczenie
Strona produktu niesie może od ośmiu do dwudziestu atrybutów: obudowę, główny parametr znamionowy, status cyklu życia, cenę, stan magazynowy. Karta katalogowa niesie ich setki: dopuszczalne wartości graniczne, charakterystyki elektryczne w funkcji temperatury, diagramy czasowe, opisy wyprowadzeń, wartości rezystancji termicznej, zalecane pola lutownicze, poziom wrażliwości na wilgoć, klucze do odczytu numerów katalogowych. Niemal każde pytanie, jakie inżynier faktycznie zadaje asystentowi — czy mogę zasilać to napięciem 5,5 V, jaki jest prąd spoczynkowy w 85 stopniach, czy rozkład wyprowadzeń jest zgodny z częścią, którą wymieniam — ma odpowiedź w karcie katalogowej i nigdzie indziej.
Ma to dziś większe znaczenie niż kiedyś, bo pytania trafiają do asystentów, zamiast być wpisywane w wyszukiwarkę na Twojej stronie. Forrester ustalił w styczniu 2026 roku, że 94% nabywców biznesowych korzysta dziś z AI w procesie zakupowym. A strony o największej głębi technicznej wypadają najgorzej: w kwietniowej analizie maszynowej czytelności handlu detalicznego Adobe przyznał stronom szczegółów produktu 66%, najniżej ze wszystkich typów stron — poniżej stron głównych z wynikiem 75% i stron FAQ z 80%.
Kiedy dane źródłowe są nieosiągalne, awaria nie polega na milczeniu — polega na pewnym siebie błędzie. W marcu 2026 roku OpenAI wygasiło Instant Checkout w ChatGPT przy około 30 podłączonych sprzedawcach, a kluczowym powodem były niedokładne dane produktowe: OpenAI zbierało informacje o produktach ze stron handlowych, a dane o stanach magazynowych, wysyłce i cenach często okazywały się błędne. To dokładnie ten sam tryb awarii co błędna wartość graniczna, tylko o niższej stawce.
Pięć sposobów, w jakie karta katalogowa staje się nieczytelna
| Awaria | Co widzi crawler | Jak to wykryć |
|---|---|---|
| Zapora botów | 403, 429 albo stronę weryfikacyjną w HTML zamiast pliku PDF | content-type odpowiedzi to text/html, a nie application/pdf |
| Skan wyłącznie obrazowy | Poprawny plik PDF bez tekstu możliwego do wyodrębnienia | Ekstrakcja tekstu zwraca 0 znaków; brak osadzonych fontów |
| Dokument tylko w podglądzie | Stronę JavaScript bez URL do pliku | PDF ładuje się z obiektu blob albo z uwierzytelnionego strumienia |
| Polityka osobnego hosta | Czyste 200 na stronie produktu i blokadę na dokumencie | Host dokumentów ma własny robots.txt i własny WAF |
| Ulotny URL albo bramka | Podpisany link, który wygasa, albo bramkę z formularzem | Link działa w Twojej przeglądarce, a z curl zwraca 403 |
Piąty przypadek jest najbardziej zawiniony przez nas samych. Krótko żyjące podpisane URL-e, bramki „zarejestruj się, aby pobrać” i tokeny jednorazowe to niewidzialne mury: crawler nie ma sesji, nie ma ciasteczek i nie wypełnia formularzy. A ponieważ crawlery AI nie wykonują kodu JavaScript, każdy link do pobrania wpisywany do DOM przez skrypt po prostu nie istnieje po ich stronie kabla.
Jak sprawdzić, czy moje karty katalogowe są czytelne?
Rozstrzygają to trzy polecenia. Uruchom je na własnych dokumentach.
- 01Sprawdź pobranie. Czy URL zwraca plik PDF zwykłemu klientowi nieprzeglądarkowemu?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"Chcesz zobaczyć końcowe 200 i content-type: application/pdf. content-type: text/html oznacza, że podano Ci stronę weryfikacyjną albo ekran logowania przebrany za pobieranie pliku.
- 01Pobierz plik i potwierdź, że to naprawdę PDF.
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdfPierwsze pięć bajtów musi brzmieć %PDF-. Jeśli to <!DOC, pobrałeś stronę błędu.
- 01Przetestuj warstwę tekstową. Tego testu nie uruchamia prawie nikt.
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdfPo czym poznać, że PDF ma warstwę tekstową?
Wystarczą dwie liczby, a przepaść między nimi jest nie do pomylenia. Przeprowadziliśmy oba testy na prawdziwej, aktualnej karcie katalogowej producenta — LM358 firmy Texas Instruments, plik PDF o rozmiarze 4,15 MB — oraz na zrasteryzowanej kopii tego samego dokumentu, która dla maszyny wygląda dokładnie tak jak zeskanowana stara karta katalogowa.
| Test | Prawdziwa karta katalogowa | Skan wyłącznie obrazowy |
|---|---|---|
Znaki wyodrębnione przez pdftotext | 95 895 | 0 |
Wiersze osadzonych fontów w pdffonts | 114 | 0 |
| Wizualnie identyczne dla człowieka | Tak | Tak |
| Użyteczne dla asystenta AI | Tak | Nie |
Na tym cała diagnostyka się kończy. Zero znaków do wyodrębnienia i zero osadzonych fontów oznacza, że w pliku nie ma tekstu — jest tylko obrazek tekstu. Dokument wyświetla się człowiekowi bez zarzutu i wnosi do modelu dosłownie nic. Zeskanowana karta katalogowa z lat 90. dla części wciąż produkowanej jest dla każdego systemu AI w internecie pustą kartką.
Dwa uzupełnienia, o których warto wiedzieć. Niska, ale niezerowa liczba znaków — powiedzmy kilkaset znaków w czterdziestostronicowym dokumencie — zwykle oznacza zeskanowaną treść z tekstowym nagłówkiem, co jest równie bezużyteczne. A w wyniku pdffonts liczy się kolumna uni: fonty osadzone jako podzbiór bez mapy ToUnicode potrafią wyekstrahować się jako nieczytelne krzaki, mimo że znaki technicznie są obecne. Sprawdź wyrywkowo pierwsze 200 znaków wyodrębnionego tekstu, zamiast ufać samej liczbie.
Aby przeczesać całą bibliotekę, zapętl to:
while read -r url; do
code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
echo "$code $chars $url"
done < datasheet-urls.txtPosortuj wynik rosnąco po liczbie znaków. Wszystko na górze tej listy to dziura w Twoich danych produktowych.
Pułapka osobnego hosta
Ta pułapka łapie duże organizacje niemal bez wyjątku, bo jest skutkiem robienia rzeczy porządnie. Dokumenty trafiają do systemu DAM, na subdomenę z dokumentacją albo do CDN, a każde z nich to odrębny origin z własną konfiguracją — i często z własnym właścicielem.
Zgodnie z RFC 9309 zakres robots.txt ogranicza się do pojedynczego origin: schematu, hosta i portu. https://www.example.com/robots.txt nie rządzi niczym pod https://docs.example.com/ ani niczym pod https://cdn.example-media.net/. Jeśli Twoja główna witryna wita crawlery AI, a host z dokumentami postawiono z domyślnego szablonu z blankietowym Disallow: / albo schowano za menedżerem botów skonfigurowanym tak, by weryfikować wszystko, co nie jest człowiekiem, to cała Twoja biblioteka techniczna jest ciemna, podczas gdy witryna marketingowa stoi otworem.
Sprawdź każdy origin, który serwuje dokumenty:
for h in www.example.com docs.example.com cdn.example-media.net; do
echo "--- $h"
curl -sS --max-time 15 "https://$h/robots.txt" | head -30
doneJak wygląda dobrze opublikowana karta katalogowa
Poprawnie opublikowana karta katalogowa nie ma w sobie nic nadzwyczajnego — i o to właśnie chodzi. Texas Instruments serwuje kartę LM358 pod stabilnym, dającym się przewidzieć URL w katalogu /lit/ds/; jego robots.txt nie nakłada na tę ścieżkę żadnych ograniczeń; plik zwraca 200 z content-type: application/pdf klientowi nieprzeglądarkowemu, który przedstawia się jako GPTBot; a sam PDF ma pełną warstwę tekstową z osadzonymi fontami zmapowanymi do Unicode. Żadnego logowania, żadnego podglądu, żadnego podpisanego URL, żadnej strony pośredniej. Odczyta go dowolny potok ekstrakcji na świecie.
Branża komponentów zmierza w stronę tego, by było jeszcze łatwiej. W listopadzie 2025 roku Microchip opublikował bezpłatny, niewymagający uwierzytelniania serwer MCP z danymi o swoich produktach — specyfikacjami, kartami katalogowymi, stanami magazynowymi, cenami i terminami dostaw — a w czerwcu 2026 roku TrustedParts należący do ECIA uruchomił usługę agenta AI do stanów magazynowych, udostępniającą dostępność u autoryzowanych dystrybutorów asystentom Copilot, ChatGPT i Claude. Oba kroki są wyrazem tego samego rozpoznania: dokument, o który maszyna musi walczyć, to dokument przegrany.
Jak to naprawić?
W kolejności zwrotu z włożonego wysiłku:
- 01Odblokuj ścieżki z dokumentami. Dopuść crawlery AI do
/datasheets/*,/lit/*,/documents/*i odpowiedników — zarówno na WAF, jak i w robots.txt. To dwa osobne przełączniki i oba muszą być ustawione. - 02Usuń bramki pobierania z publicznych dokumentów technicznych. Jeśli karta katalogowa jest na Twojej publicznej witrynie, to jest już publiczna. Formularz rejestracji zatrzymuje wyłącznie te maszyny, które by Cię poleciły.
- 03Przepuść przez OCR każdy PDF będący wyłącznie obrazem i opublikuj go ponownie z warstwą tekstową. Priorytetyzuj według przychodu z danej części, nie według wieku dokumentu. Współczesny OCR na czystym skanie 300 dpi jest niemal bezstratny dla tekstu ciągłego; tabele parametrów zweryfikuj ręcznie.
- 04Daj każdemu dokumentowi stabilny, bezpośredni URL, do którego da się podlinkować. Żadnych obiektów blob, żadnych podglądów, żadnych wygasających tokenów, żadnych parametrów
?token=w zapytaniu. - 05Opublikuj bliźniaczą wersję każdej karty katalogowej w HTML lub markdownie. Tabele specyfikacji jako prawdziwe tabele. To pojedyncza najskuteczniejsza zmiana, bo znosi całą zależność od heurystyk układu PDF i daje Ci stronę, której trafność możesz też monitorować.
- 06Podlinkuj dokument ze strony produktu w HTML renderowanym po stronie serwera, żeby crawler, który dotrze do strony, dotarł też do dokumentu bez uruchamiania czegokolwiek.
- 07Udostępnij wyodrębnione parametry jako dane strukturalne — JSON-LD na stronie, a najlepiej także odpytywalny punkt końcowy — żeby agent mógł po nich filtrować, zamiast za każdym razem od nowa parsować PDF.
W sierpniu 2026 roku Partsgraph zbadał 984 domeny dystrybutorów i producentów na całym świecie — w Ameryce Północnej, Europie i Azji. Mediana wskaźnika widoczności dla AI wyniosła 50 na 100, a 70% badanej grupy otrzymało ocenę D lub F. Warstwa dokumentów była niezmiennie najsłabszym składnikiem tego wyniku: 38% nie potrafiło zaserwować standardowemu klientowi nieprzeglądarkowemu ani jednej czytelnej strony katalogowej, a dostęp do dokumentów zawodził częściej niż dostęp do stron.
Niewygodne jest to, że nic z tego nie widać w Twojej analityce. Zablokowany crawler nie zgłosi błędu, kiepski OCR nie rzuci wyjątku, a model, który nie potrafi odczytać Twojej karty katalogowej, nie powie nabywcy, że nie potrafił jej odczytać. Po prostu poleci konkurenta, którego PDF się otworzył.
Własną bibliotekę dokumentów możesz sprawdzić tymi testami za pomocą bezpłatnego gradera widoczności dla AI od Partsgraph pod adresem [/audit](/audit).
Najczęstsze pytania
Czy crawlery AI w ogóle potrafią czytać pliki PDF?
Potrafią je pobrać, a ekstrakcja tekstu z PDF jest standardowym elementem potoków przetwarzania danych. Czego nie potrafią, to wymyślić tekstu, którego w pliku nie ma. Ekstrakcja czyta warstwę tekstową; jeśli PDF jest zeskanowanym obrazem bez warstwy tekstowej, ekstrakcja nie zwraca nic, a dokument nie wnosi nic.
Jak rozpoznać, czy PDF ma warstwę tekstową?
Uruchom na pliku pdftotext i policz zwrócone znaki, a następnie uruchom pdffonts i policz wiersze. Zdrowa karta katalogowa zwraca dziesiątki tysięcy znaków i długą listę osadzonych fontów. Skan wyłącznie obrazowy zwraca zero znaków i zero fontów.
Moje karty katalogowe są na osobnej subdomenie z dokumentacją. Czy to ma znaczenie?
Tak. Zgodnie z RFC 9309 zakres robots.txt ogranicza się do pojedynczego origin — schematu, hosta i portu. Przyzwalający robots.txt na www.example.com nie daje żadnych uprawnień na docs.example.com ani na hoście Twojego CDN. Każdy origin serwujący dokumenty potrzebuje własnej polityki i każdy z osobna podlega Twoim regułom WAF.
Czy treść karty katalogowej powinna trafić na stronę WWW jako HTML?
Tak i zwykle jest to poprawka o najwyższym zwrocie. Bliźniacza wersja każdej karty katalogowej w HTML lub markdownie — tabele specyfikacji, dopuszczalne wartości graniczne, opisy wyprowadzeń, informacje o zamawianiu — jest trywialnie parsowalna, cache’owalna i łatwa do zacytowania, a przy tym znosi wszelką zależność od tego, jak dobrze ekstraktor PDF radzi sobie z Twoim układem strony.
Czy blokowanie botów na hoście z dokumentami ochroni moją własność intelektualną?
Przede wszystkim ochroni Cię przed byciem polecanym. Karty katalogowe są już powielone u agregatorów, więc zablokowanie crawlera rzadko usuwa treść z korpusu treningowego; oznacza tylko tyle, że wersja, którą widzi model, to nieaktualna kopia podmiotu trzeciego, a nie Twoja bieżąca rewizja. Jeśli celem jest kontrola, serwuj dokument autorytatywny i monitoruj jego trafność.
Czy układy wielokolumnowe i tabele przetrwają ekstrakcję?
Niedoskonale. Dwukolumnowe układy kart katalogowych przy liniowej ekstrakcji często się przeplatają, a tabele parametrów ze scalonymi komórkami tracą strukturę wierszy. Tagowane pliki PDF z poprawną kolejnością czytania pomagają znacząco, ale lustrzana wersja tych samych tabel w HTML lub markdownie usuwa niejednoznaczność całkowicie.
Ile kart katalogowych powinienem przetestować?
Najpierw przetestuj 20 najpopularniejszych pod względem ruchu, a potem przeczesz skryptem całą bibliotekę. Z naszego doświadczenia awarie grupują się według rocznika dokumentu i narzędzia, w którym powstał, więc próbka obejmująca wyłącznie nowe części będzie wyglądać dużo zdrowiej, niż biblioteka wygląda naprawdę.
Źródła
- 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
- 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
- 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
- 04Forrester, The State Of Business Buying, 2026 (January 2026)
- 05Vercel and MERJ, The rise of the AI crawler, December 2024
- 06RFC 9309, Robots Exclusion Protocol
- 07Microchip Technology, MCP Server press release, November 2025
- 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
- 09Texas Instruments, LM358 datasheet (used as a worked example)
Zobacz dokładnie, co asystenci AI potrafią dziś odczytać z Twoich produktów, a czego nie — polityka wobec robotów indeksujących, pokrycie katalogu, dostęp do kart katalogowych — wraz z oceną i porównaniem z 984 dystrybutorami i producentami z całego świata.
Oceń mój katalogPowiązane notatki z terenu
Crawlery AI nie wykonują kodu JavaScript
GPTBot, ClaudeBot i PerplexityBot czytają surowy HTML i nigdy nie wykonują skryptów. Jak sprawdzić, czy katalo…
TechnikaMCP dla producentów: praktyczny przewodnik
Czym jest Model Context Protocol, co powinien udostępniać serwer MCP z danymi części, jak OAuth chroni ceny i …
ZgodnośćMapowanie wymogów cyfrowego paszportu na pola ETIM
DPP nakazuje dane do odczytu maszynowego, ale nie wskazuje słownika. Każdy wymóg zmapowany na strukturę ETIM, …