Yapay zeka tarayıcıları için robots.txt: 2026 rehberi
Kısaca
2026'da yapay zeka tarayıcıları için robots.txt'i nasıl yapılandırmalıyım?
Yapay zeka istemcilerini tek bir grup olarak değil, üç sınıf olarak ele alın: eğitim tarayıcıları (GPTBot, ClaudeBot, CCBot, Google-Extended), arama indeksleyicileri (OAI-SearchBot, Claude-SearchBot, PerplexityBot) ve kullanıcı tetiklemeli getiriciler (ChatGPT-User, Perplexity-User, Gemini-Deep-Research). İlk ikisi, içeriği model eğitimi için ve yanıt motorlarının alıntı yaptığı erişim indeksleri için toplar; her ikisi de robots.txt'e uyar. Üçüncüsü ise gerçek bir kişi gerçek bir soru sorduğunda devreye girer ve operatörlerin çoğu, robots.txt'in bunun için geçerli olmayabileceğini belgelerinde açıkça belirtir. Eğitim sınıfını engellemek bir lisanslama kararıdır; kullanıcı tetiklemeli getiricileri engellemek ise canlı bir müşteriye cevap vermeyi reddetmektir.
Kısa cevap
"Yapay zeka botlarını" tek bir şeymiş gibi düşünmeyi bırakın. Ekonomileri birbirinden tamamen farklı üç sınıf var ve hepsine birden uygulanan tek bir Disallow satırı neredeyse her zaman yanlış bir takas.
Training
- GPTBot
- ClaudeBot
- Google-Extended
- CCBot
Asking to learn from your catalogue. Declining is a licensing decision, and a defensible one.
Search index
- OAI-SearchBot
- PerplexityBot
- Applebot-Extended
Asking to be able to cite you. Blocking these removes you from answers you would have won.
User-triggered
- ChatGPT-User
- Claude-User
- Perplexity-User
A person with a bill of materials open, mid-decision, right now. This is a customer, not a scraper.
Bir eğitim tarayıcısı kataloğunuzdan öğrenmek için izin ister. Bir arama indeksleyicisi onu alıntılayabilmek için izin ister. Kullanıcı tetiklemeli bir getirici ise tam şu anda ürününüz hakkında soru soran bir müşteridir. Birincisini engellemek bir lisanslama kararıdır. Üçüncüsünü engellemek telefonu yüzüne kapatmaktır.
Forrester, kurumsal alıcıların %94'ünün en son satın alma sürecinde yapay zeka kullandığını ortaya koydu. Kaynak sunucunuza yapay zeka user-agent'ıyla gelen isteklerin kayda değer bir kısmı veri kazıma değildir — karşınızdaki, önünde bir malzeme listesi açık, karar aşamasındaki bir insandır. robots.txt dosyanız bu ikisini ayırt etmeli; çoğu dosya ayırt etmiyor.
2026'da önem taşıyan tüm yapay zeka user-agent'ları
| Token | Operatör | Sınıf | robots.txt'e uyuyor mu | Kaynak IP doğrulaması |
|---|---|---|---|---|
GPTBot | OpenAI | Eğitim | Evet | gptbot.json |
OAI-SearchBot | OpenAI | Arama indeksi | Evet | searchbot.json |
ChatGPT-User | OpenAI | Kullanıcı tetiklemeli | "geçerli olmayabilir" | chatgpt-user.json |
ClaudeBot | Anthropic | Eğitim | Evet | bots.json |
Claude-SearchBot | Anthropic | Arama indeksi | Evet | bots.json |
Claude-User | Anthropic | Kullanıcı tetiklemeli | Evet | bots.json |
PerplexityBot | Perplexity | Arama indeksi | Evet | perplexitybot.json |
Perplexity-User | Perplexity | Kullanıcı tetiklemeli | "genellikle yok sayar" | perplexity-user.json |
Google-Extended | Eğitim izni token'ı | Evet, token olarak | Getirici değil | |
Gemini-Deep-Research | Kullanıcı tetiklemeli araştırma ajanı | Genellikle yok sayar | Google getirici aralıkları | |
Applebot-Extended | Apple | Eğitim izni token'ı | Evet, token olarak | Getirici değil |
Amazonbot | Amazon | Eğitim ve ürün geliştirme | Evet | Amazon IP listesi |
Bytespider | ByteDance | Eğitim | Tartışmalı | Yayımlanmış liste yok |
CCBot | Common Crawl | Birçok modeli besleyen toplu arşiv | Evet | Ters DNS |
Meta-ExternalAgent | Meta | Eğitim ve indeksleme | Evet | Meta dokümantasyonu |
Bu tablodaki beş nokta sürekli yanlış anlaşılıyor ya da gözden kaçıyor; açıkça söylemekte fayda var.
`Google-Extended` ve `Applebot-Extended` birer tarayıcı değildir. İkisi de hiçbir şey getirmez. Bunlar izin token'larıdır: Google-Extended, Googlebot tarafından zaten taranmış içeriğin Gemini'yi eğitmek ve yanıtlarını temellendirmek için kullanılıp kullanılamayacağını denetler; Apple'ın dokümantasyonu ise Applebot-Extended'ın "web sayfalarını taramadığını" ve "yalnızca Applebot user-agent'ının taradığı verinin nasıl kullanılacağını belirlemek için kullanıldığını" açıkça belirtir. Applebot-Extended'a Disallow uygulamak sizi Siri, Spotlight ya da Safari sonuçlarından çıkarmaz.
Kullanıcı tetiklemeli getiriler konusunda istisna Anthropic. OpenAI, ChatGPT-User için "bu eylemler bir kullanıcı tarafından başlatıldığından robots.txt kurallarının geçerli olmayabileceğini" belirtiyor. Perplexity, Perplexity-User'ın "robots.txt kurallarını genellikle yok saydığını" söylüyor. Google, kullanıcı tetiklemeli getiricileri için "istek bir kullanıcı tarafından yapıldığından, bu getiriciler robots.txt kurallarını genellikle yok sayar" diyor. Amazon, Amzn-User'ın "tüm robots.txt yönergelerine uymayabileceğini" belirtiyor. Anthropic ise bunun aksine botlarının robots.txt'e uyduğunu belgeliyor ve Claude-User'ı, site sahiplerinin kullanıcı kaynaklı istekleri denetlemek için kullanabileceği bir token olarak adlandırıyor. Tüm kümeye birden Disallow uygularsanız gerçekten duracak olan Claude olur — ki bu, çoğu kişinin amaçladığının tam tersidir.
Amazon ve Meta ikiye bölünmüş birer filo işletiyor. Amazon, Amazonbot'un yanı sıra Amzn-SearchBot (Alexa ve Rufus dahil arama deneyimleri) ve Amzn-User (canlı kullanıcı eylemleri) token'larını belgeliyor ve her ikisinin de üretken yapay zeka eğitimi için tarama yapmadığını söylüyor. Meta ise eğitim ve indeksleme için Meta-ExternalAgent, kullanıcı talebiyle yapılan getiriler için Meta-ExternalFetcher çalıştırıyor; ikincisi robots.txt'i atlayabiliyor.
Bytespider bir robots.txt sorunu değil, bir politika sorunudur. ByteDance robots.txt'e uyduğunu belirtiyor; site operatörleri ise yaygın biçimde aksini bildiriyor. Durdurmak istiyorsanız kenar katmanında durdurun, bu dosyaya güvenmeyin.
`Gemini-Deep-Research` hakkında bir not: Google'ın yayımladığı tarayıcı dokümantasyonu bu token'ı henüz ne yaygın tarayıcıları ne de kullanıcı tetiklemeli getiricileri arasında listeliyor, ama token aktif olarak kullanımda ve büyük distribütörler onu şimdiden adıyla ele alıyor — Digi-Key'in robots.txt dosyası; GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User ve Claude-SearchBot'un yanı sıra hem Google-Extended hem de Gemini-Deep-Research için açıkça izin veriyor. Siz de listeye ekleyin; robots.txt'te tanınmayan bir token zararsızdır.
Her sınıfı engellemenin gerçek maliyeti nedir?
| Şunu engellerseniz | Kaybettiğiniz | Kazandığınız |
|---|---|---|
| Eğitim tarayıcıları | Gelecekteki model ağırlıklarında yer almak; model web'e başvurmadan yanıt verirken varsayılan cevap olmak | Bir lisanslama duruşu ve marjinal ölçüde daha az bant genişliği |
| Arama indeksleyicileri | ChatGPT, Claude ve Perplexity yanıtlarında alıntılanmak | Herkese açık bir katalog için kayda değer hiçbir şey |
| Kullanıcı tetiklemeli getiriciler | Canlı bir alıcının sorusunu yanıtlayabilme imkânı | Hiçbir şey |
Kataloğu zaten herkese açık olan ve zaten toplayıcılara kopyalanmış bir üretici ya da distribütör için eğitim sınıfını engellemek büyük ölçüde semboliktir: veri, distribütör listeleri ve Common Crawl üzerinden modellere nasılsa ulaşır. Değişen tek şey, modelin verinizin kimin sürümünü tuttuğudur. Diğer iki sınıfı engellemenin ise herkese açık bir katalog için hiçbir faydası yoktur.
Kopyala-yapıştır robots.txt
Tarif A: azami ajan görünürlüğü
Kataloğu herkese açık olan ve ticari çıkarı bulunmak ve doğru biçimde alıntılanmak olan bir üretici ya da distribütör için doğru varsayılan.
# --- Answer engines and user-triggered fetchers ---
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
User-agent: Amzn-SearchBot
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /
# --- Training crawlers and permission tokens ---
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /
# --- Everything else ---
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://www.example.com/sitemap.xml
Sitemap: https://www.example.com/sitemap-products.xmlTarif B: erişime izin ver, eğitimi reddet
Model eğitimine katkıda bulunmama kararını bilinçli olarak almış, ama yine de bulunmak ve alıntılanmak isteyen kuruluşlar için. Bunun bedelini not edin: Google-Extended'a Disallow uygulamak, içeriğinizi eğitimin yanı sıra Gemini'nin yanıt temellendirmesinden de çıkarır.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /
User-agent: *
Disallow: /account/Tarif C: katalog açık, gerisi kapalı
Öne çıkmasını istediğiniz varlıklar katalog ve doküman kütüphanesiyse ve geri kalan her şey gürültüyse işe yarar.
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Disallow: /
Allow: /products/
Allow: /catalog/
Allow: /datasheets/
Allow: /documents/
Allow: /sitemap-products.xmlRFC 9309 uyarınca en uzun eşleşen yol kuralı kazanır; dolayısıyla Allow satırları, o önekler için genel Disallow: / kuralını geçersiz kılar. Sonucu varsaymak yerine doğrulayın — ayrıştırıcıların uç durumlardaki davranışı hâlâ değişkenlik gösteriyor.
Karşılığı olan bir "hayır" demek: Content Signals
robots.txt erişimi denetler. Baytlar sunulduktan sonraki kullanım hakkında hiçbir şey söylemez. Cloudflare'ın 24 Eylül 2025'te yayına aldığı Content Signals Policy, aynı dosyaya makine tarafından okunabilir bir kullanım tercihi ekliyor ve üç sinyal içeriyor: search (bir arama indeksi oluşturmak ve arama sonuçları sunmak), ai-input (içeriği bir ya da daha fazla yapay zeka modeline girdi olarak vermek) ve ai-train (yapay zeka modellerini eğitmek ya da ince ayar yapmak).
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /account/Cloudflare, yönetilen robots.txt özelliğini etkinleştirmiş 3,8 milyondan fazla alan adına search=yes, ai-train=no uyguladı ve tahmin yürütmek yerine ai-input alanını bilerek boş bıraktı. Bu bir uygulama mekanizması değil, beyan edilmiş bir tercihtir — ama açık, tarihli ve makine tarafından okunabilir bir niyet beyanıdır; bulundurmaya değer.
Sessizlik neden giderek "hayır" anlamına geliyor
Yirmi yıl boyunca robots.txt'te bir kuralın bulunmaması "evet" demekti. Bu varsayılan, altyapı katmanında geri çekiliyor ve dosyaya hiç dokunmamış üreticiler CDN'leri tarafından kapsam dışı bırakılıyor.
- 1 Temmuz 2025 — web'in kabaca beşte birinin önünde duran Cloudflare, yapay zeka tarayıcılarını varsayılan olarak engelleyen ilk büyük altyapı sağlayıcısı oldu ve yeni eklenen her alan adına, bu tarayıcılara izin verilip verilmeyeceğini baştan sormaya başladı.
- 24 Eylül 2025 — Content Signals Policy yayına alındı; yönetilen 3,8 milyon alan adına varsayılan olarak
ai-train=nouygulandı. - 1 Temmuz 2026 — Cloudflare, 15 Eylül 2026'dan itibaren yeni alan adlarında, mevcut müşterilerin yeni sitelerinde ve ücretsiz katmandaki tüm mevcut müşterilerde, reklam gösteren sayfalarda Training ve Agent tarayıcı kategorilerinin varsayılan olarak engelleneceğini duyurdu. Search'e izin verilmeye devam ediyor. Search ile Training'i harmanlayan çok amaçlı tarayıcılar en kısıtlayıcı kuralı devralıyor.
Sonuncusunu tam olarak okuyun, çünkü çok sık yanlış aktarılıyor. Kapsamı reklamla gelir elde eden sayfalarla sınırlı; üretici kataloglarının çoğu bu kapsama girmiyor. Sizi hâlihazırda etkileyen değişiklik 2025 tarihli olan: siteniz yakın zamanda modern bir CDN'e taşındıysa ya da ücretsiz bir katmanda duruyorsa, kimse böyle bir karar almamış olsa bile yapay zeka tarayıcılarını çoktan geri çeviriyor olabilirsiniz. Varsaymadan önce kontrol edin.
robots.txt bir ricadır. Uygulamayı WAF'ınız yapar.
İyi niyetli yapılandırmaların çoğu tam burada çuvallıyor. robots.txt, uyumlu istemcilerin okuduğu gönüllü bir protokoldür. Bot yöneticiniz ise doğrulanmış kaynak IP'ye göre sınıflandırma yapan katı bir kapıdır ve varsayılan kural setleri, web tarayıcısına benzemeyen her şeye rutin olarak challenge uygular ya da onu engeller. Allow: / satırını okuyup ardından bir JavaScript challenge'ı alan bir tarayıcı, dosya ne derse desin engellenmiştir.
Her büyük operatör, düzgün biçimde izin listesine alabilesiniz diye IP aralıklarını yayımlıyor:
| Operatör | Yayımlanan aralıklar |
|---|---|
| OpenAI | gptbot.json, searchbot.json, chatgpt-user.json |
| Anthropic | claude.com/crawling/bots.json |
| Perplexity | perplexitybot.json, perplexity-user.json |
| googlebot.json, special-crawlers.json, user-triggered-fetchers-google.json | |
| Amazon | developer.amazon.com/amazonbot |
Loglarınızdaki belirli bir adresin gerçekten OpenAI'a ait olup olmadığını kontrol etmek için:
python3 - <<'EOF'
import ipaddress, json, urllib.request
probe = ipaddress.ip_address("132.196.86.5")
data = json.load(urllib.request.urlopen("https://openai.com/gptbot.json"))
nets = [ipaddress.ip_network(p.get("ipv4Prefix") or p.get("ipv6Prefix"))
for p in data["prefixes"]]
print(any(probe in n for n in nets if n.version == probe.version))
EOFKenar katmanındaki üç kural işin çoğunu hallediyor:
- 01Doğrulanmış IP aralıklarını, bot skoru kuralınız devreye girmeden önce izin listesine alın; yalnızca herkese açık katalog ve doküman yollarıyla sınırlı olacak şekilde.
- 02Bu yolları JavaScript challenge'larından ve hız sınırlarından muaf tutun. Web tarayıcısı olmayan bir istemci challenge çözemez ve 40.000 SKU indeksleyen bir tarayıcı, insanlara göre ayarlanmış bir hız sınırına takılır.
- 03İzin listesini user-agent dizesine göre oluşturmayın. O yalnızca serbest metinden ibaret bir başlıktır. Önce IP üzerinden eşleştirin, isterseniz sonra user-agent'ı da ekleyin.
Her origin'in ayrı ayrı yapılandırıldığını unutmayın. Ürün sitenizin, dokümantasyon alt alan adınızın ve CDN ana bilgisayar adınızın her birinin kendi robots.txt dosyasına ve kendi WAF politikasına ihtiyacı vardır.
Loglarımdan işe yaradığını nasıl doğrularım?
Loglarda doğrulamadığınız bir yapılandırma yalnızca bir varsayımdır. Sonuç hakkında hüküm vermeden önce birkaç gün bekleyin: operatörler robots.txt'i önbelleğe alıyor; Meta'nın dokümantasyonu değişikliklerin yürürlüğe girmesinin 24 saati bulabileceği uyarısını yapıyor, Amazon ise tarayıcılarının son 30 gün içinde önbelleğe alınmış bir kopyayı kullanabileceğini söylüyor. Ardından:
grep -aiE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Gemini-Deep-Research|Applebot|Amazonbot|Bytespider|CCBot|Meta-External" access.log | wc -lSonra bunu ajana ve durum koduna göre ayrıştırın — asıl önemli sayı budur:
awk '/GPTBot/ {print $9}' access.log | sort | uniq -c | sort -rnAradığınız şeyler:
- 01Her ajan için sıfırdan farklı bir hacim. Herkese açık bir katalogda 72 saat boyunca hiçbir yapay zeka ajanından istek gelmemesi, popüler olmadığınız değil, yukarı akışta engellendiğiniz anlamına gelir.
- 022xx ağırlıklı bir durum dağılımı. Bir 403 duvarı, WAF'ın robots.txt'i geçersiz kıldığını gösterir. Bir 404 duvarı, site haritanızın ya da iç bağlantılarınızın artık var olmayan URL'lere işaret ettiği anlamına gelir.
- 03Yalnızca ürün yollarının değil, doküman yollarının da görünmesi.
/datasheets/hiç görünmüyorsa teknik kütüphaneniz görünmez demektir. - 04Mantıklı yanıt boyutları. Ürün URL'lerinde tekrarlayan 4–15 KB'lık 200 yanıtları genellikle tarayıcıların boş, istemci tarafında render edilen bir kabuk aldığı anlamına gelir — teknik olarak izinli, pratikte işe yaramaz.
- 05Kullanıcı tetiklemeli ajanların hiç değilse görünmesi. ChatGPT-User, Claude-User ve Perplexity-User trafiği, alıcı ilgisine dair elinizdeki gerçek zamanlıya en yakın sinyaldir. Ayrıca raporlanmaya değer.
Sık yapılan hatalar
- Eğitim tarayıcılarını hedefleyen genel bir kuralla, kullanıcı tetiklemeli getiricileri kazara engellemek.
- robots.txt'i doğru ayarlayıp WAF'a hiç dokunmamak. Bunlar iki ayrı anahtardır ve ikisinin de ayarlanması gerekir.
- RFC 9309 kapsamında her biri ayrı birer origin olan dokümantasyon alt alan adını, DAM'i ve CDN'i unutmak.
- Tarayıcıları CSS ve JavaScript varlıklarından engellemek. Yalnızca metin işleyen tarayıcılar için fark etmez, ama Googlebot da Applebot da render eder; onları varlıklardan mahrum bırakmak gördüklerini bozar.
- Bir toplayıcının verinizi doğru taşıdığını varsaymak. O, ne zaman kazıdıysa onu taşır.
llms.txt'i bir ikame olarak görmek. Hiçbir büyük operatör onu okumayı taahhüt etmedi ve loglar genellikle bu dosyanın hiç istenmediğini gösteriyor.
Partsgraph, Ağustos 2026'da Kuzey Amerika, Avrupa ve Asya'da olmak üzere dünya genelinde 984 distribütör ve üretici alan adını denetledi. Yalnızca %19'u herhangi bir açık yapay zeka tarayıcı politikası yayımlamıştı — ve yayımlayanlar arasında büyük bir yapay zeka tarayıcısını engelleyenlerin sayısı, davet edenlerin iki katından fazlaydı. Hiçbiri bir MCP uç noktası duyurmuyordu. Medyan yapay zeka görünürlük puanı: 100 üzerinden 50. Bu açık henüz rekabet konusu değil — iyi kurgulanmış bir robots.txt'in, bir ürün verisi ekibinin harcayabileceği en yüksek kaldıraçlı saatlerden biri olmaya devam etmesinin nedeni de tam olarak bu.
Yapay zeka tarayıcılarının alan adınızda gerçekte neye erişebildiğini ücretsiz Partsgraph derecelendiricisiyle [/audit](/audit) adresinden kontrol edin.
Sık sorulan sorular
GPTBot ile ChatGPT-User arasındaki fark nedir?
GPTBot, OpenAI'ın temel modelleri için eğitim verisi toplayan toplu bir tarayıcıdır ve robots.txt'e uyar. ChatGPT-User ise birisi ChatGPT'ye o sayfayı gerektiren bir soru sorduğu için tek bir sayfayı getirir. OpenAI'ın dokümantasyonu, bu eylemler bir kullanıcı tarafından başlatıldığından robots.txt kurallarının geçerli olmayabileceğini belirtir. GPTBot'u engellemek bir lisanslama kararıdır; ChatGPT-User'ı engellemek, canlı bir müşterinin sorusunu yanıtsız bırakmaktır.
Google-Extended bir tarayıcı mıdır?
Hayır. Google-Extended bir getirici değil, robots.txt içinde kullanılan bir denetim token'ıdır. Baytlar yine Googlebot üzerinden gelir. Google-Extended'a Disallow uygulamak, Google'a içeriği Gemini modellerini eğitmek ya da yanıtlarını temellendirmek için kullanmamasını söyler; normal Arama indekslemesi ise olduğu gibi kalır. Applebot-Extended, Apple tarafında aynı şekilde çalışır.
Yapay zeka eğitim tarayıcılarını engellemek kataloğumu yapay zeka modellerinin dışında tutar mı?
Büyük ölçüde hayır ve üstelik size görünürlük kaybettirir. Komponent verisi distribütörler, toplayıcılar ve Common Crawl arasında kopyalanır; dolayısıyla içerik genellikle yine de modellere ulaşır — ama sizin güncel ve yetkili sürümünüz olarak değil, bir üçüncü tarafın bayatlamış kopyası olarak. Anlamlı bir denetim kazanmadan, alıntılanan kaynak olma imkânınızı kaybedersiniz.
Ana alan adımdaki robots.txt, dokümantasyon alt alan adımı da kapsar mı?
Hayır. RFC 9309 uyarınca robots.txt tek bir origin ile sınırlıdır: şema, ana bilgisayar ve port. CDN ana bilgisayar adınızın, DAM'inizin ve dokümantasyon alt alan adınızın her birinin kendi dosyasına ihtiyacı vardır. robots.txt'te açık görünen bir sitenin bir tarayıcıya hiçbir şey sunmamasının en yaygın nedeni tam olarak budur.
robots.txt dosyam Allow dediği hâlde tarayıcılar neden engelleniyor?
Çünkü robots.txt bir ricadır, uygulamayı yapan ise WAF'ınızdır. Bot yöneticileri sınıflandırmayı user-agent dizesine göre değil, doğrulanmış kaynak IP'ye göre yapar ve birçok varsayılan kural, web tarayıcısı olmayan her şeye challenge uygular. Doğrulanmış tarayıcı IP aralıklarına robots.txt'te izin vermenin yanı sıra onları kenar katmanında da izin listesine almanız gerekir.
Bunun yerine llms.txt kullanmalı mıyım?
Bunun yerine değil. 2026 itibarıyla hiçbir büyük yapay zeka operatörü llms.txt'i okumayı taahhüt etmedi ve Google'ın Search Relations ekibi bunu desteklemekten kaçındı. Sunucu logları genellikle yapay zeka tarayıcılarının bu dosyayı hiç istemediğini gösteriyor. İsterseniz yayımlayın; ama davranışı gerçekten değiştiren şeyler robots.txt, gerçekten bağlantı verilmiş sayfalar ve doğrulanmış botlar için tutulan izin listesidir.
Bir isteğin gerçekten GPTBot'tan geldiğini, sahtecilik olmadığını nasıl doğrularım?
Kaynak IP'yi, OpenAI'ın openai.com/gptbot.json adresinde yayımladığı önek listesiyle karşılaştırın. Her büyük operatör eşdeğer bir JSON dosyası yayımlıyor, Google ise ters DNS doğrulamasını destekliyor. Yalnızca user-agent dizesine asla güvenmeyin — taklit edilmesi çok kolaydır ve yapay zeka tarayıcısı olduğunu iddia eden trafiğin büyük bir kısmı gerçek değildir.
Kaynaklar
- 01OpenAI, Overview of OpenAI crawlers
- 02Anthropic, Does Anthropic crawl data from the web?
- 03Perplexity, PerplexityBot and Perplexity-User documentation
- 04Google Search Central, Google crawlers and user agents
- 05Google Search Central, user-triggered fetchers
- 06Apple Support, About Applebot
- 07Amazon, About Amazonbot
- 08Meta for Developers, Meta web crawlers
- 09Cloudflare, Content Independence Day: new AI traffic options, July 2026
- 10Cloudflare, Content Signals Policy, September 2025
- 11Cloudflare press release, blocking AI crawlers by default, July 2025
- 12RFC 9309, Robots Exclusion Protocol
- 13Forrester, The State Of Business Buying, 2026 (January 2026)
Yapay zeka asistanlarının bugün ürünlerinizde tam olarak neleri okuyup neleri okuyamadığını görün — tarayıcı politikası, katalog kapsamı, teknik doküman erişimi — puanlanmış ve dünya genelindeki 984 distribütör ve üreticiyle kıyaslanmış olarak.
Kataloğumu puanlaİlgili saha notları
Yapay zeka tarayıcıları JavaScript çalıştırmaz
GPTBot, ClaudeBot ve PerplexityBot ham HTML okur, script çalıştırmaz. Kataloğunuz görünür mü, nasıl test edili…
ÇözümAjana hazır ürün kataloğu nedir?
Ajana hazır bir katalog dört makine yüzeyi sunar. Her birinin ne olduğunu, hangi yapay zeka asistanlarının kul…
AraştırmaDağıtımın Devleri Yapay Zeka Okunabilirliğinde En Kötüsü
984 endüstriyel kataloğu puanladık, ardından 25 tanınmış markayı canlı olarak yeniden ölçtük. Medyanları 40; p…