robots.txt dla crawlerów AI: przewodnik 2026
W skrócie
Jak skonfigurować robots.txt dla crawlerów AI w 2026 roku?
Traktuj klienty AI jako trzy klasy, a nie jedną: crawlery treningowe (GPTBot, ClaudeBot, CCBot, Google-Extended), indeksery wyszukiwania (OAI-SearchBot, Claude-SearchBot, PerplexityBot) oraz fetchery uruchamiane przez użytkownika (ChatGPT-User, Perplexity-User, Gemini-Deep-Research). Dwie pierwsze zbierają treść na potrzeby trenowania modeli oraz indeksów wyszukiwania, z których cytują silniki odpowiedzi, i obie respektują robots.txt. Trzecia uruchamia się wtedy, gdy realna osoba zadaje realne pytanie, a większość operatorów dokumentuje, że robots.txt może jej nie dotyczyć. Zablokowanie klasy treningowej to decyzja licencyjna; zablokowanie fetcherów uruchamianych przez użytkownika to odmowa odpowiedzi klientowi na żywo.
Krótka odpowiedź
Przestań myśleć o „botach AI” jak o jednej kategorii. Są trzy klasy o zupełnie różnej ekonomii, a pojedyncza linia Disallow zastosowana do nich wszystkich to niemal zawsze zły kompromis.
Training
- GPTBot
- ClaudeBot
- Google-Extended
- CCBot
Asking to learn from your catalogue. Declining is a licensing decision, and a defensible one.
Search index
- OAI-SearchBot
- PerplexityBot
- Applebot-Extended
Asking to be able to cite you. Blocking these removes you from answers you would have won.
User-triggered
- ChatGPT-User
- Claude-User
- Perplexity-User
A person with a bill of materials open, mid-decision, right now. This is a customer, not a scraper.
Crawler treningowy prosi o możliwość uczenia się z Twojego katalogu. Indekser wyszukiwania prosi o możliwość cytowania go. Fetcher uruchamiany przez użytkownika to klient, który właśnie teraz zadaje pytanie o Twój produkt. Zablokowanie pierwszego to decyzja licencyjna. Zablokowanie trzeciego to odłożenie słuchawki.
Forrester ustalił, że 94% nabywców biznesowych korzystało z AI w swoim ostatnim procesie zakupowym. Znacząca część pobrań trafiających do Twojego serwera origin z user-agentem AI to nie scraping — to ktoś, kto ma otwartą listę materiałową i jest w trakcie podejmowania decyzji. Twój robots.txt powinien je rozróżniać, a większość tego nie robi.
Każdy liczący się user-agent AI w 2026 roku
| Token | Operator | Klasa | Respektuje robots.txt | Weryfikacja źródłowego IP |
|---|---|---|---|---|
GPTBot | OpenAI | Trening | Tak | gptbot.json |
OAI-SearchBot | OpenAI | Indeks wyszukiwania | Tak | searchbot.json |
ChatGPT-User | OpenAI | Uruchamiany przez użytkownika | „może nie mieć zastosowania” | chatgpt-user.json |
ClaudeBot | Anthropic | Trening | Tak | bots.json |
Claude-SearchBot | Anthropic | Indeks wyszukiwania | Tak | bots.json |
Claude-User | Anthropic | Uruchamiany przez użytkownika | Tak | bots.json |
PerplexityBot | Perplexity | Indeks wyszukiwania | Tak | perplexitybot.json |
Perplexity-User | Perplexity | Uruchamiany przez użytkownika | „zwykle ignoruje” | perplexity-user.json |
Google-Extended | Token zgody na trening | Tak, jako token | Nie jest fetcherem | |
Gemini-Deep-Research | Agent badawczy uruchamiany przez użytkownika | Zwykle ignoruje | Zakresy fetcherów Google | |
Applebot-Extended | Apple | Token zgody na trening | Tak, jako token | Nie jest fetcherem |
Amazonbot | Amazon | Trening i doskonalenie produktów | Tak | Lista adresów IP Amazon |
Bytespider | ByteDance | Trening | Sporne | Nie opublikowano |
CCBot | Common Crawl | Zbiorcze archiwum zasilające wiele modeli | Tak | Odwrotny DNS |
Meta-ExternalAgent | Meta | Trening i indeksowanie | Tak | Dokumentacja Meta |
Pięć pozycji w tej tabeli jest nagminnie źle rozumianych albo pomijanych i warto powiedzieć o nich wprost.
`Google-Extended` i `Applebot-Extended` nie są crawlerami. Żaden z nich niczego nie pobiera. To tokeny zgody: Google-Extended decyduje o tym, czy treść zebrana już przez Googlebot może posłużyć do trenowania modeli Gemini i do groundingu ich odpowiedzi, a dokumentacja Apple mówi wprost, że Applebot-Extended „nie crawluje stron internetowych” i jest „używany wyłącznie do określenia, w jaki sposób wykorzystać dane zebrane przez user-agenta Applebot”. Zablokowanie Applebot-Extended nie usuwa Cię z wyników Siri, Spotlight ani Safari.
Anthropic jest wyjątkiem w kwestii pobrań uruchamianych przez użytkownika. OpenAI podaje, że w przypadku ChatGPT-User „ponieważ te działania są inicjowane przez użytkownika, reguły robots.txt mogą nie mieć zastosowania”. Perplexity pisze, że Perplexity-User „zwykle ignoruje reguły robots.txt”. Dokumentacja Google mówi o swoich fetcherach uruchamianych przez użytkownika: „ponieważ pobranie zostało zażądane przez użytkownika, fetchery te zwykle ignorują reguły robots.txt”. Amazon podaje, że Amzn-User „może nie stosować się do wszystkich dyrektyw robots.txt”. Anthropic natomiast dokumentuje, że jego boty respektują robots.txt, i wskazuje Claude-User jako token, którym właściciele witryn mogą sterować żądaniami inicjowanymi przez użytkownika. Jeśli zablokujesz cały zestaw, to właśnie Claude jako jedyny faktycznie się zatrzyma — czyli stanie się dokładna odwrotność tego, o co większości osób chodzi.
Amazon i Meta prowadzą po kilka botów naraz. Poza Amazonbot Amazon dokumentuje Amzn-SearchBot (funkcje wyszukiwania, w tym Alexa i Rufus) oraz Amzn-User (działania użytkownika na żywo); o obu podaje, że nie crawlują na potrzeby trenowania generatywnej AI. Meta prowadzi Meta-ExternalAgent do trenowania i indeksowania oraz Meta-ExternalFetcher do pobrań na żądanie użytkownika, przy czym ten drugi może omijać robots.txt.
Bytespider to problem polityki, a nie robots.txt. ByteDance deklaruje, że respektuje robots.txt; operatorzy witryn powszechnie raportują coś przeciwnego. Jeśli chcesz go zatrzymać, zatrzymaj go na brzegu sieci i nie polegaj na pliku.
Uwaga o `Gemini-Deep-Research`: opublikowana dokumentacja crawlerów Google nie wymienia jeszcze tego tokena wśród swoich typowych crawlerów ani fetcherów uruchamianych przez użytkownika, ale jest on w aktywnym użyciu, a najwięksi dystrybutorzy już odnoszą się do niego po nazwie — robots.txt firmy Digi-Key wprost zezwala zarówno na Google-Extended, jak i Gemini-Deep-Research, obok GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User i Claude-SearchBot. Uwzględnij go; nierozpoznany token w robots.txt jest nieszkodliwy.
Ile naprawdę kosztuje zablokowanie każdej z klas?
| Jeśli zablokujesz | Tracisz | Zyskujesz |
|---|---|---|
| Crawlery treningowe | Obecność w wagach przyszłych modeli; bycie domyślną odpowiedzią offline | Pozycję licencyjną i nieznacznie mniejsze zużycie pasma |
| Indeksery wyszukiwania | Cytowanie w odpowiedziach ChatGPT, Claude i Perplexity | Nic istotnego dla publicznego katalogu |
| Fetchery uruchamiane przez użytkownika | Możliwość odpowiedzi na pytanie realnego nabywcy | Nic |
Dla producenta albo dystrybutora, którego katalog jest już publiczny i już powielony u agregatorów, blokowanie klasy treningowej jest w większości symboliczne: dane i tak trafiają do modeli — przez listingi dystrybutorów i Common Crawl. Zmienia się tylko to, czyją wersję Twoich danych ma model. Blokowanie dwóch pozostałych klas nie daje publicznemu katalogowi żadnej korzyści.
Gotowe do skopiowania pliki robots.txt
Wariant A: maksymalna widoczność dla agentów
Właściwe ustawienie domyślne dla producenta lub dystrybutora, którego katalog jest publiczny, a interesem handlowym jest bycie znajdowanym i trafnie cytowanym.
# --- Answer engines and user-triggered fetchers ---
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
User-agent: Amzn-SearchBot
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /
# --- Training crawlers and permission tokens ---
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /
# --- Everything else ---
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://www.example.com/sitemap.xml
Sitemap: https://www.example.com/sitemap-products.xmlWariant B: zezwól na wyszukiwanie, odmów treningu
Dla organizacji, które świadomie zdecydowały, że nie chcą zasilać trenowania modeli, ale nadal chcą być znajdowane i cytowane. Zwróć uwagę na koszt: zablokowanie Google-Extended usuwa Twoje treści nie tylko z trenowania, lecz także z groundingu Gemini.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
User-agent: *
Disallow: /account/Wariant C: katalog otwarty, reszta zamknięta
Przydatny, gdy katalog i biblioteka dokumentów są tymi zasobami, które chcesz eksponować, a reszta majątku cyfrowego to szum.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Disallow: /
Allow: /products/
Allow: /catalog/
Allow: /datasheets/
Allow: /documents/
Allow: /sitemap-products.xmlZgodnie z RFC 9309 wygrywa najdłuższa pasująca reguła ścieżki, więc linie Allow nadpisują ogólne Disallow: / dla tych prefiksów. Zweryfikuj wynik, zamiast go zakładać — zachowanie parserów w przypadkach brzegowych wciąż bywa różne.
Jak wyrazić „nie” tak, żeby coś znaczyło: Content Signals
robots.txt kontroluje dostęp. Nie mówi nic o wykorzystaniu po tym, jak bajty zostały już wysłane. Content Signals Policy firmy Cloudflare, uruchomiona 24 września 2025 roku, dodaje do tego samego pliku czytelną maszynowo preferencję dotyczącą użycia, z trzema sygnałami: search (budowanie indeksu wyszukiwania i dostarczanie wyników wyszukiwania), ai-input (wprowadzanie treści do jednego modelu AI lub większej ich liczby) oraz ai-train (trenowanie lub dostrajanie modeli AI).
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /account/Cloudflare zastosował search=yes, ai-train=no w ponad 3,8 miliona domen, które włączyły jego zarządzany robots.txt, celowo pozostawiając ai-input bez wartości, zamiast zgadywać. To deklarowana preferencja, a nie mechanizm egzekwowania — ale jest to jasne, opatrzone datą i czytelne maszynowo oświadczenie o zamiarach, które warto mieć.
Dlaczego milczenie zaczyna oznaczać „nie”
Przez dwadzieścia lat brak reguły w robots.txt oznaczał „tak”. To domyślne założenie jest właśnie wycofywane na poziomie infrastruktury, a producenci, którzy nigdy nie tknęli tego pliku, są wypisywani z indeksowania przez własne CDN.
- 1 lipca 2025 — Cloudflare, który stoi przed mniej więcej jedną piątą sieci, jako pierwszy duży dostawca infrastruktury zaczął domyślnie blokować crawlery AI, pytając każdą nowo podłączaną domenę wprost, czy je dopuścić.
- 24 września 2025 — weszła w życie Content Signals Policy, z
ai-train=noustawionym domyślnie dla 3,8 miliona zarządzanych domen. - 1 lipca 2026 — Cloudflare ogłosił, że od 15 września 2026 w nowych domenach, w nowych witrynach dotychczasowych klientów oraz u wszystkich obecnych klientów planu darmowego kategorie crawlerów Training i Agent będą domyślnie blokowane na stronach wyświetlających reklamy. Search pozostaje dozwolony. Crawlery wielofunkcyjne, łączące Search z Training, dziedziczą najbardziej restrykcyjną regułę.
Ten ostatni punkt czytaj dokładnie, bo jest powszechnie przekręcany. Dotyczy wyłącznie stron monetyzowanych reklamami, a większość katalogów producenckich nimi nie jest. Zmiana, która już Cię dotyczy, to ta z 2025 roku: jeśli Twoja witryna trafiła niedawno na nowoczesne CDN albo działa na planie darmowym, być może już odmawiasz dostępu crawlerom AI, choć nikt świadomie tak nie zdecydował. Sprawdź, zanim założysz.
robots.txt to prośba. Egzekwuje ją Twój WAF.
To właśnie tutaj zawodzi większość konfiguracji tworzonych w dobrej wierze. robots.txt jest dobrowolnym protokołem, który czytają klienty chcące go przestrzegać. Twój bot manager to twarda bramka klasyfikująca ruch po zweryfikowanym źródłowym adresie IP, a domyślne zestawy reguł rutynowo kwestionują albo blokują wszystko, co nie wygląda jak przeglądarka. Crawler, który odczyta Allow: /, a potem dostanie wyzwanie JavaScript, został zablokowany — niezależnie od tego, co mówi plik.
Każdy liczący się operator publikuje swoje zakresy, żeby dało się je poprawnie dodać do allowlisty:
| Operator | Publikowane zakresy |
|---|---|
| OpenAI | gptbot.json, searchbot.json, chatgpt-user.json |
| Anthropic | claude.com/crawling/bots.json |
| Perplexity | perplexitybot.json, perplexity-user.json |
| googlebot.json, special-crawlers.json, user-triggered-fetchers-google.json | |
| Amazon | developer.amazon.com/amazonbot |
Aby sprawdzić, czy konkretny adres w Twoich logach naprawdę należy do OpenAI:
python3 - <<'EOF'
import ipaddress, json, urllib.request
probe = ipaddress.ip_address("132.196.86.5")
data = json.load(urllib.request.urlopen("https://openai.com/gptbot.json"))
nets = [ipaddress.ip_network(p.get("ipv4Prefix") or p.get("ipv6Prefix"))
for p in data["prefixes"]]
print(any(probe in n for n in nets if n.version == probe.version))
EOFTrzy reguły na brzegu sieci załatwiają większość sprawy:
- 01Dodaj zweryfikowane zakresy do allowlisty, zanim zadziała reguła oceny botów, ograniczając to wyłącznie do ścieżek publicznego katalogu i dokumentów.
- 02Zwolnij te ścieżki z wyzwań JavaScript i z limitów szybkości. Klient niebędący przeglądarką nie rozwiąże wyzwania, a crawler indeksujący 40 000 SKU przekroczy limit ustawiony pod ludzi.
- 03Nie buduj allowlisty na podstawie ciągu user-agent. To zwykły nagłówek tekstowy. Dopasowuj po IP, a dopiero opcjonalnie po user-agencie.
Pamiętaj, że każdy origin konfiguruje się osobno. Twoja witryna produktowa, subdomena z dokumentacją i host CDN — każde z nich potrzebuje własnego robots.txt i własnej polityki WAF.
Jak sprawdzić w logach, że zadziałało?
Konfiguracja, której nie zweryfikowałeś w logach, jest hipotezą. Odczekaj kilka dni przed oceną wyniku: operatorzy cache'ują robots.txt, a dokumentacja Meta ostrzega, że zmiany mogą zacząć obowiązywać nawet po 24 godzinach, natomiast Amazon podaje, że jego crawlery mogą korzystać z kopii zbuforowanej w ciągu ostatnich 30 dni. Następnie:
grep -aiE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Gemini-Deep-Research|Applebot|Amazonbot|Bytespider|CCBot|Meta-External" access.log | wc -lNastępnie rozbij to na agentów i kody statusu — to jest liczba, która ma znaczenie:
awk '/GPTBot/ {print $9}' access.log | sort | uniq -c | sort -rnCzego szukasz:
- 01Niezerowego wolumenu dla każdego agenta. Zero żądań od jakiegokolwiek agenta AI przez 72 godziny na publicznym katalogu oznacza, że jesteś blokowany wyżej w stosie, a nie po prostu mało popularny.
- 02Rozkładu statusów zdominowanego przez 2xx. Ściana kodów 403 oznacza, że WAF nadpisuje robots.txt. Ściana kodów 404 oznacza, że Twoja mapa witryny albo linki wewnętrzne wskazują adresy URL, które już nie istnieją.
- 03Pojawiania się ścieżek dokumentów, nie tylko produktowych. Jeśli
/datasheets/nigdy się nie pojawia, Twoja biblioteka techniczna jest niewidoczna. - 04Rozmiarów odpowiedzi, które mają sens. Powtarzające się odpowiedzi 200 o wielkości 4–15 KB pod adresami URL produktów zwykle oznaczają, że crawlery dostają pustą skorupę renderowaną po stronie klienta — formalnie dozwolone, praktycznie bezużyteczne.
- 05Obecności agentów uruchamianych przez użytkownika w ogóle. Ruch ChatGPT-User, Claude-User i Perplexity-User to najbliższa rzecz, jaką masz, sygnałowi zainteresowania nabywców w czasie rzeczywistym. Warto raportować go osobno.
Najczęstsze błędy
- Przypadkowe blokowanie fetcherów uruchamianych przez użytkownika w ogólnej regule wymierzonej w crawlery treningowe.
- Poprawne ustawienie robots.txt i pozostawienie WAF bez zmian. To dwa przełączniki i oba trzeba przestawić.
- Zapomnienie o subdomenie z dokumentacją, o systemie DAM i o CDN, z których każde jest zgodnie z RFC 9309 osobnym originem.
- Blokowanie crawlerom dostępu do zasobów CSS i JavaScript. Dla crawlerów czysto tekstowych nie ma to znaczenia, ale Googlebot i Applebot renderują, a odcinanie ich od zasobów pogarsza to, co widzą.
- Zakładanie, że agregator wiernie odwzorowuje Twoje dane. Niesie to, co zescrapował, i z tego momentu, w którym to zrobił.
- Traktowanie
llms.txtjako zamiennika. Żaden liczący się operator nie zobowiązał się do jego czytania, a logi zwykle pokazują, że nikt o niego nie prosi.
W sierpniu 2026 roku Partsgraph zbadał 984 domeny dystrybutorów i producentów na całym świecie — w Ameryce Północnej, Europie i Azji. Tylko 19% publikowało jakąkolwiek jawną politykę wobec crawlerów AI, a wśród tych, które to robiły, ponad dwa razy więcej blokowało któryś z liczących się crawlerów AI, niż go zapraszało. Żadna nie ogłaszała endpointu MCP. Mediana wyniku widoczności dla AI: 50 na 100. Ta luka nie jest jeszcze przewagą konkurencyjną — i właśnie dlatego dobrze napisany robots.txt to wciąż jedna z najbardziej opłacalnych godzin pracy dostępnych zespołowi ds. danych produktowych.
Sprawdź, do czego crawlery AI faktycznie docierają w Twojej domenie, korzystając z bezpłatnego gradera Partsgraph pod adresem [/audit](/audit).
Najczęstsze pytania
Czym różni się GPTBot od ChatGPT-User?
GPTBot to zbiorczy crawler zbierający dane treningowe dla modeli podstawowych OpenAI i respektuje robots.txt. ChatGPT-User pobiera pojedynczą stronę, ponieważ ktoś zadał ChatGPT pytanie, które tego wymaga. Dokumentacja OpenAI stwierdza, że ponieważ te działania są inicjowane przez użytkownika, reguły robots.txt mogą nie mieć zastosowania. Zablokowanie GPTBot to decyzja licencyjna; zablokowanie ChatGPT-User to odmowa odpowiedzi na pytanie realnego klienta.
Czy Google-Extended jest crawlerem?
Nie. Google-Extended to token sterujący w robots.txt, a nie fetcher. Bajty i tak przychodzą przez Googlebot. Zablokowanie Google-Extended mówi Google, żeby nie wykorzystywał treści do trenowania modeli Gemini ani do groundingu odpowiedzi, pozostawiając zwykłe indeksowanie w wyszukiwarce nietknięte. Applebot-Extended działa tak samo po stronie Apple.
Czy zablokowanie treningowych crawlerów AI utrzyma mój katalog poza modelami AI?
W dużej mierze nie, a będzie Cię kosztować widoczność. Dane o komponentach są powielone u dystrybutorów, agregatorów i w Common Crawl, więc treść zwykle i tak dociera do modeli — tyle że jako nieaktualna kopia podmiotu trzeciego, a nie Twoja bieżąca, autorytatywna wersja. Tracisz możliwość bycia cytowanym źródłem, nie zyskując realnej kontroli.
Czy robots.txt w mojej domenie głównej obejmuje subdomenę z dokumentacją?
Nie. Zgodnie z RFC 9309 robots.txt obowiązuje w obrębie jednego originu: schematu, hosta i portu. Host Twojego CDN, system DAM i subdomena z dokumentacją — każde z nich potrzebuje własnego pliku. To zdecydowanie najczęstszy powód, dla którego witryna wyglądająca w robots.txt na otwartą i tak nie serwuje crawlerowi niczego.
Dlaczego mój robots.txt mówi Allow, a crawlery i tak są blokowane?
Ponieważ robots.txt jest prośbą, a egzekwuje ją Twój WAF. Systemy zarządzania botami klasyfikują ruch po zweryfikowanym źródłowym adresie IP, a nie po ciągu user-agent, i wiele domyślnych reguł kwestionuje wszystko, co nie jest przeglądarką. Zweryfikowane zakresy crawlerów trzeba dodać do allowlisty na brzegu sieci, a nie tylko dopuścić w robots.txt.
Czy zamiast tego powinienem użyć llms.txt?
Nie zamiast. Na rok 2026 żaden liczący się operator AI nie zobowiązał się do czytania llms.txt, a zespół Search Relations w Google odmówił jego poparcia. Logi serwerów zwykle pokazują, że crawlery AI nigdy nie proszą o ten plik. Opublikuj go, jeśli chcesz, ale to robots.txt, prawdziwe podlinkowane strony i allowlista zweryfikowanych botów realnie zmieniają zachowanie.
Jak potwierdzić, że żądanie naprawdę pochodzi od GPTBot, a nie od podszywacza?
Sprawdź źródłowy adres IP na publikowanej przez OpenAI liście prefiksów pod adresem openai.com/gptbot.json. Każdy liczący się operator publikuje odpowiednik takiego pliku JSON, a Google obsługuje weryfikację przez odwrotny DNS. Nigdy nie ufaj samemu ciągowi user-agent — podrobienie go jest trywialne, a duża część ruchu podającego się za crawler AI nim nie jest.
Źródła
- 01OpenAI, Overview of OpenAI crawlers
- 02Anthropic, Does Anthropic crawl data from the web?
- 03Perplexity, PerplexityBot and Perplexity-User documentation
- 04Google Search Central, Google crawlers and user agents
- 05Google Search Central, user-triggered fetchers
- 06Apple Support, About Applebot
- 07Amazon, About Amazonbot
- 08Meta for Developers, Meta web crawlers
- 09Cloudflare, Content Independence Day: new AI traffic options, July 2026
- 10Cloudflare, Content Signals Policy, September 2025
- 11Cloudflare press release, blocking AI crawlers by default, July 2025
- 12RFC 9309, Robots Exclusion Protocol
- 13Forrester, The State Of Business Buying, 2026 (January 2026)
Zobacz dokładnie, co asystenci AI potrafią dziś odczytać z Twoich produktów, a czego nie — polityka wobec robotów indeksujących, pokrycie katalogu, dostęp do kart katalogowych — wraz z oceną i porównaniem z 984 dystrybutorami i producentami z całego świata.
Oceń mój katalogPowiązane notatki z terenu
Crawlery AI nie wykonują kodu JavaScript
GPTBot, ClaudeBot i PerplexityBot czytają surowy HTML i nigdy nie wykonują skryptów. Jak sprawdzić, czy katalo…
RozwiązanieCzym jest katalog produktów gotowy dla agentów AI?
Katalog gotowy dla agentów obsługuje cztery powierzchnie maszynowe. Czym jest każda z nich, którzy asystenci A…
BadaniaNajwięksi dystrybutorzy: najgorsza czytelność dla AI
Oceniliśmy 984 katalogi przemysłowe, a potem zmierzyliśmy na żywo 25 znanych marek. Ich mediana to 40 wobec me…