# Yapay zeka tarayıcıları için robots.txt: 2026 rehberi

> 2026'da önemli her yapay zeka user-agent'ı, kimin işlettiği, hangilerinin robots.txt'e uyduğu, hazır yapılandırmalar, WAF izin listesi ve loglardan doğrulama.

**Language:** tr  
**Published:** 2026-08-09  
**Category:** Solution · **Tags:** robots.txt, AI crawlers, GPTBot, ClaudeBot, bot management, WAF, Content Signals  
**Canonical:** https://partsgraph.ai/tr/blog/robots-txt-for-ai-crawlers-guide

## Kısaca

**2026'da yapay zeka tarayıcıları için robots.txt'i nasıl yapılandırmalıyım?**

Yapay zeka istemcilerini tek bir grup olarak değil, üç sınıf olarak ele alın: eğitim tarayıcıları (GPTBot, ClaudeBot, CCBot, Google-Extended), arama indeksleyicileri (OAI-SearchBot, Claude-SearchBot, PerplexityBot) ve kullanıcı tetiklemeli getiriciler (ChatGPT-User, Perplexity-User, Gemini-Deep-Research). İlk ikisi, içeriği model eğitimi için ve yanıt motorlarının alıntı yaptığı erişim indeksleri için toplar; her ikisi de robots.txt'e uyar. Üçüncüsü ise gerçek bir kişi gerçek bir soru sorduğunda devreye girer ve operatörlerin çoğu, robots.txt'in bunun için geçerli olmayabileceğini belgelerinde açıkça belirtir. Eğitim sınıfını engellemek bir lisanslama kararıdır; kullanıcı tetiklemeli getiricileri engellemek ise canlı bir müşteriye cevap vermeyi reddetmektir.

---

## Kısa cevap

"Yapay zeka botlarını" tek bir şeymiş gibi düşünmeyi bırakın. Ekonomileri birbirinden tamamen farklı üç sınıf var ve hepsine birden uygulanan tek bir `Disallow` satırı neredeyse her zaman yanlış bir takas.

> **Figure.** The three classes of AI user-agent — training crawlers, search indexers and user-triggered fetchers — and why one blanket rule is the wrong trade.

> Bir eğitim tarayıcısı kataloğunuzdan öğrenmek için izin ister. Bir arama indeksleyicisi onu alıntılayabilmek için izin ister. Kullanıcı tetiklemeli bir getirici ise tam şu anda ürününüz hakkında soru soran bir müşteridir. Birincisini engellemek bir lisanslama kararıdır. Üçüncüsünü engellemek telefonu yüzüne kapatmaktır.

Forrester, **kurumsal alıcıların %94'ünün en son satın alma sürecinde yapay zeka kullandığını** ortaya koydu. Kaynak sunucunuza yapay zeka user-agent'ıyla gelen isteklerin kayda değer bir kısmı veri kazıma değildir — karşınızdaki, önünde bir malzeme listesi açık, karar aşamasındaki bir insandır. robots.txt dosyanız bu ikisini ayırt etmeli; çoğu dosya ayırt etmiyor.

## 2026'da önem taşıyan tüm yapay zeka user-agent'ları

| Token | Operatör | Sınıf | robots.txt'e uyuyor mu | Kaynak IP doğrulaması |
|---|---|---|---|---|
| `GPTBot` | OpenAI | Eğitim | Evet | [gptbot.json](https://openai.com/gptbot.json) |
| `OAI-SearchBot` | OpenAI | Arama indeksi | Evet | [searchbot.json](https://openai.com/searchbot.json) |
| `ChatGPT-User` | OpenAI | Kullanıcı tetiklemeli | "geçerli olmayabilir" | [chatgpt-user.json](https://openai.com/chatgpt-user.json) |
| `ClaudeBot` | Anthropic | Eğitim | Evet | [bots.json](https://claude.com/crawling/bots.json) |
| `Claude-SearchBot` | Anthropic | Arama indeksi | Evet | [bots.json](https://claude.com/crawling/bots.json) |
| `Claude-User` | Anthropic | Kullanıcı tetiklemeli | Evet | [bots.json](https://claude.com/crawling/bots.json) |
| `PerplexityBot` | Perplexity | Arama indeksi | Evet | [perplexitybot.json](https://www.perplexity.com/perplexitybot.json) |
| `Perplexity-User` | Perplexity | Kullanıcı tetiklemeli | "genellikle yok sayar" | [perplexity-user.json](https://www.perplexity.com/perplexity-user.json) |
| `Google-Extended` | Google | Eğitim izni token'ı | Evet, token olarak | Getirici değil |
| `Gemini-Deep-Research` | Google | Kullanıcı tetiklemeli araştırma ajanı | Genellikle yok sayar | [Google getirici aralıkları](https://developers.google.com/static/search/apis/ipranges/user-triggered-fetchers-google.json) |
| `Applebot-Extended` | Apple | Eğitim izni token'ı | Evet, token olarak | Getirici değil |
| `Amazonbot` | Amazon | Eğitim ve ürün geliştirme | Evet | [Amazon IP listesi](https://developer.amazon.com/amazonbot/ip-addresses/) |
| `Bytespider` | ByteDance | Eğitim | Tartışmalı | Yayımlanmış liste yok |
| `CCBot` | Common Crawl | Birçok modeli besleyen toplu arşiv | Evet | Ters DNS |
| `Meta-ExternalAgent` | Meta | Eğitim ve indeksleme | Evet | Meta dokümantasyonu |

Bu tablodaki beş nokta sürekli yanlış anlaşılıyor ya da gözden kaçıyor; açıkça söylemekte fayda var.

**`Google-Extended` ve `Applebot-Extended` birer tarayıcı değildir.** İkisi de hiçbir şey getirmez. Bunlar izin token'larıdır: Google-Extended, Googlebot tarafından zaten taranmış içeriğin Gemini'yi eğitmek ve yanıtlarını temellendirmek için kullanılıp kullanılamayacağını denetler; Apple'ın dokümantasyonu ise Applebot-Extended'ın "web sayfalarını taramadığını" ve "yalnızca Applebot user-agent'ının taradığı verinin nasıl kullanılacağını belirlemek için kullanıldığını" açıkça belirtir. Applebot-Extended'a Disallow uygulamak sizi Siri, Spotlight ya da Safari sonuçlarından çıkarmaz.

**Kullanıcı tetiklemeli getiriler konusunda istisna Anthropic.** OpenAI, ChatGPT-User için "bu eylemler bir kullanıcı tarafından başlatıldığından robots.txt kurallarının geçerli olmayabileceğini" belirtiyor. Perplexity, Perplexity-User'ın "robots.txt kurallarını genellikle yok saydığını" söylüyor. Google, kullanıcı tetiklemeli getiricileri için "istek bir kullanıcı tarafından yapıldığından, bu getiriciler robots.txt kurallarını genellikle yok sayar" diyor. Amazon, Amzn-User'ın "tüm robots.txt yönergelerine uymayabileceğini" belirtiyor. Anthropic ise bunun aksine botlarının robots.txt'e uyduğunu belgeliyor ve Claude-User'ı, site sahiplerinin kullanıcı kaynaklı istekleri denetlemek için kullanabileceği bir token olarak adlandırıyor. Tüm kümeye birden Disallow uygularsanız gerçekten duracak olan Claude olur — ki bu, çoğu kişinin amaçladığının tam tersidir.

**Amazon ve Meta ikiye bölünmüş birer filo işletiyor.** Amazon, Amazonbot'un yanı sıra `Amzn-SearchBot` (Alexa ve Rufus dahil arama deneyimleri) ve `Amzn-User` (canlı kullanıcı eylemleri) token'larını belgeliyor ve her ikisinin de üretken yapay zeka eğitimi için tarama yapmadığını söylüyor. Meta ise eğitim ve indeksleme için `Meta-ExternalAgent`, kullanıcı talebiyle yapılan getiriler için `Meta-ExternalFetcher` çalıştırıyor; ikincisi robots.txt'i atlayabiliyor.

**Bytespider bir robots.txt sorunu değil, bir politika sorunudur.** ByteDance robots.txt'e uyduğunu belirtiyor; site operatörleri ise yaygın biçimde aksini bildiriyor. Durdurmak istiyorsanız kenar katmanında durdurun, bu dosyaya güvenmeyin.

**`Gemini-Deep-Research` hakkında bir not:** Google'ın yayımladığı tarayıcı dokümantasyonu bu token'ı henüz ne yaygın tarayıcıları ne de kullanıcı tetiklemeli getiricileri arasında listeliyor, ama token aktif olarak kullanımda ve büyük distribütörler onu şimdiden adıyla ele alıyor — Digi-Key'in robots.txt dosyası; GPTBot, ChatGPT-User, OAI-SearchBot, PerplexityBot, Perplexity-User, ClaudeBot, Claude-User ve Claude-SearchBot'un yanı sıra hem `Google-Extended` hem de `Gemini-Deep-Research` için açıkça izin veriyor. Siz de listeye ekleyin; robots.txt'te tanınmayan bir token zararsızdır.

## Her sınıfı engellemenin gerçek maliyeti nedir?

| Şunu engellerseniz | Kaybettiğiniz | Kazandığınız |
|---|---|---|
| Eğitim tarayıcıları | Gelecekteki model ağırlıklarında yer almak; model web'e başvurmadan yanıt verirken varsayılan cevap olmak | Bir lisanslama duruşu ve marjinal ölçüde daha az bant genişliği |
| Arama indeksleyicileri | ChatGPT, Claude ve Perplexity yanıtlarında alıntılanmak | Herkese açık bir katalog için kayda değer hiçbir şey |
| Kullanıcı tetiklemeli getiriciler | Canlı bir alıcının sorusunu yanıtlayabilme imkânı | Hiçbir şey |

Kataloğu zaten herkese açık olan ve zaten toplayıcılara kopyalanmış bir üretici ya da distribütör için eğitim sınıfını engellemek büyük ölçüde semboliktir: veri, distribütör listeleri ve Common Crawl üzerinden modellere nasılsa ulaşır. Değişen tek şey, modelin verinizin kimin sürümünü tuttuğudur. Diğer iki sınıfı engellemenin ise herkese açık bir katalog için hiçbir faydası yoktur.

## Kopyala-yapıştır robots.txt

### Tarif A: azami ajan görünürlüğü

Kataloğu herkese açık olan ve ticari çıkarı bulunmak ve doğru biçimde alıntılanmak olan bir üretici ya da distribütör için doğru varsayılan.

```
# --- Answer engines and user-triggered fetchers ---
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
User-agent: Amzn-SearchBot
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /

# --- Training crawlers and permission tokens ---
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/
Allow: /

# --- Everything else ---
User-agent: *
Disallow: /account/
Disallow: /cart/
Disallow: /checkout/

Sitemap: https://www.example.com/sitemap.xml
Sitemap: https://www.example.com/sitemap-products.xml
```

### Tarif B: erişime izin ver, eğitimi reddet

Model eğitimine katkıda bulunmama kararını bilinçli olarak almış, ama yine de bulunmak ve alıntılanmak isteyen kuruluşlar için. Bunun bedelini not edin: Google-Extended'a Disallow uygulamak, içeriğinizi eğitimin yanı sıra Gemini'nin yanıt temellendirmesinden de çıkarır.

```
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Bytespider
User-agent: Meta-ExternalAgent
User-agent: Amazonbot
User-agent: Google-Extended
User-agent: Applebot-Extended
Disallow: /

User-agent: *
Disallow: /account/
```

### Tarif C: katalog açık, gerisi kapalı

Öne çıkmasını istediğiniz varlıklar katalog ve doküman kütüphanesiyse ve geri kalan her şey gürültüyse işe yarar.

```
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Gemini-Deep-Research
Disallow: /
Allow: /products/
Allow: /catalog/
Allow: /datasheets/
Allow: /documents/
Allow: /sitemap-products.xml
```

RFC 9309 uyarınca en uzun eşleşen yol kuralı kazanır; dolayısıyla `Allow` satırları, o önekler için genel `Disallow: /` kuralını geçersiz kılar. Sonucu varsaymak yerine doğrulayın — ayrıştırıcıların uç durumlardaki davranışı hâlâ değişkenlik gösteriyor.

## Karşılığı olan bir "hayır" demek: Content Signals

robots.txt *erişimi* denetler. Baytlar sunulduktan sonraki *kullanım* hakkında hiçbir şey söylemez. Cloudflare'ın 24 Eylül 2025'te yayına aldığı Content Signals Policy, aynı dosyaya makine tarafından okunabilir bir kullanım tercihi ekliyor ve üç sinyal içeriyor: `search` (bir arama indeksi oluşturmak ve arama sonuçları sunmak), `ai-input` (içeriği bir ya da daha fazla yapay zeka modeline girdi olarak vermek) ve `ai-train` (yapay zeka modellerini eğitmek ya da ince ayar yapmak).

```
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /account/
```

Cloudflare, yönetilen robots.txt özelliğini etkinleştirmiş 3,8 milyondan fazla alan adına `search=yes, ai-train=no` uyguladı ve tahmin yürütmek yerine `ai-input` alanını bilerek boş bıraktı. Bu bir uygulama mekanizması değil, beyan edilmiş bir tercihtir — ama açık, tarihli ve makine tarafından okunabilir bir niyet beyanıdır; bulundurmaya değer.

## Sessizlik neden giderek "hayır" anlamına geliyor

Yirmi yıl boyunca robots.txt'te bir kuralın bulunmaması "evet" demekti. Bu varsayılan, altyapı katmanında geri çekiliyor ve dosyaya hiç dokunmamış üreticiler CDN'leri tarafından kapsam dışı bırakılıyor.

- **1 Temmuz 2025** — web'in kabaca beşte birinin önünde duran Cloudflare, yapay zeka tarayıcılarını varsayılan olarak engelleyen ilk büyük altyapı sağlayıcısı oldu ve yeni eklenen her alan adına, bu tarayıcılara izin verilip verilmeyeceğini baştan sormaya başladı.
- **24 Eylül 2025** — Content Signals Policy yayına alındı; yönetilen 3,8 milyon alan adına varsayılan olarak `ai-train=no` uygulandı.
- **1 Temmuz 2026** — Cloudflare, **15 Eylül 2026**'dan itibaren yeni alan adlarında, mevcut müşterilerin yeni sitelerinde ve ücretsiz katmandaki tüm mevcut müşterilerde, reklam gösteren sayfalarda Training ve Agent tarayıcı kategorilerinin varsayılan olarak engelleneceğini duyurdu. Search'e izin verilmeye devam ediyor. Search ile Training'i harmanlayan çok amaçlı tarayıcılar en kısıtlayıcı kuralı devralıyor.

Sonuncusunu tam olarak okuyun, çünkü çok sık yanlış aktarılıyor. Kapsamı reklamla gelir elde eden sayfalarla sınırlı; üretici kataloglarının çoğu bu kapsama girmiyor. Sizi hâlihazırda etkileyen değişiklik 2025 tarihli olan: siteniz yakın zamanda modern bir CDN'e taşındıysa ya da ücretsiz bir katmanda duruyorsa, kimse böyle bir karar almamış olsa bile yapay zeka tarayıcılarını çoktan geri çeviriyor olabilirsiniz. Varsaymadan önce kontrol edin.

## robots.txt bir ricadır. Uygulamayı WAF'ınız yapar.

İyi niyetli yapılandırmaların çoğu tam burada çuvallıyor. robots.txt, uyumlu istemcilerin okuduğu gönüllü bir protokoldür. Bot yöneticiniz ise **doğrulanmış kaynak IP**'ye göre sınıflandırma yapan katı bir kapıdır ve varsayılan kural setleri, web tarayıcısına benzemeyen her şeye rutin olarak challenge uygular ya da onu engeller. `Allow: /` satırını okuyup ardından bir JavaScript challenge'ı alan bir tarayıcı, dosya ne derse desin engellenmiştir.

Her büyük operatör, düzgün biçimde izin listesine alabilesiniz diye IP aralıklarını yayımlıyor:

| Operatör | Yayımlanan aralıklar |
|---|---|
| OpenAI | [gptbot.json](https://openai.com/gptbot.json), [searchbot.json](https://openai.com/searchbot.json), [chatgpt-user.json](https://openai.com/chatgpt-user.json) |
| Anthropic | [claude.com/crawling/bots.json](https://claude.com/crawling/bots.json) |
| Perplexity | [perplexitybot.json](https://www.perplexity.com/perplexitybot.json), [perplexity-user.json](https://www.perplexity.com/perplexity-user.json) |
| Google | [googlebot.json](https://developers.google.com/static/search/apis/ipranges/googlebot.json), [special-crawlers.json](https://developers.google.com/static/search/apis/ipranges/special-crawlers.json), [user-triggered-fetchers-google.json](https://developers.google.com/static/search/apis/ipranges/user-triggered-fetchers-google.json) |
| Amazon | [developer.amazon.com/amazonbot](https://developer.amazon.com/amazonbot) |

Loglarınızdaki belirli bir adresin gerçekten OpenAI'a ait olup olmadığını kontrol etmek için:

```
python3 - <<'EOF'
import ipaddress, json, urllib.request
probe = ipaddress.ip_address("132.196.86.5")
data = json.load(urllib.request.urlopen("https://openai.com/gptbot.json"))
nets = [ipaddress.ip_network(p.get("ipv4Prefix") or p.get("ipv6Prefix"))
        for p in data["prefixes"]]
print(any(probe in n for n in nets if n.version == probe.version))
EOF
```

Kenar katmanındaki üç kural işin çoğunu hallediyor:

1. **Doğrulanmış IP aralıklarını, bot skoru kuralınız devreye girmeden önce izin listesine alın**; yalnızca herkese açık katalog ve doküman yollarıyla sınırlı olacak şekilde.
2. **Bu yolları JavaScript challenge'larından ve hız sınırlarından muaf tutun.** Web tarayıcısı olmayan bir istemci challenge çözemez ve 40.000 SKU indeksleyen bir tarayıcı, insanlara göre ayarlanmış bir hız sınırına takılır.
3. **İzin listesini user-agent dizesine göre oluşturmayın.** O yalnızca serbest metinden ibaret bir başlıktır. Önce IP üzerinden eşleştirin, isterseniz sonra user-agent'ı da ekleyin.

Her origin'in ayrı ayrı yapılandırıldığını unutmayın. Ürün sitenizin, dokümantasyon alt alan adınızın ve CDN ana bilgisayar adınızın her birinin kendi robots.txt dosyasına ve kendi WAF politikasına ihtiyacı vardır.

## Loglarımdan işe yaradığını nasıl doğrularım?

Loglarda doğrulamadığınız bir yapılandırma yalnızca bir varsayımdır. Sonuç hakkında hüküm vermeden önce birkaç gün bekleyin: operatörler robots.txt'i önbelleğe alıyor; Meta'nın dokümantasyonu değişikliklerin yürürlüğe girmesinin 24 saati bulabileceği uyarısını yapıyor, Amazon ise tarayıcılarının son 30 gün içinde önbelleğe alınmış bir kopyayı kullanabileceğini söylüyor. Ardından:

```
grep -aiE "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-User|Claude-SearchBot|PerplexityBot|Perplexity-User|Gemini-Deep-Research|Applebot|Amazonbot|Bytespider|CCBot|Meta-External" access.log | wc -l
```

Sonra bunu ajana ve durum koduna göre ayrıştırın — asıl önemli sayı budur:

```
awk '/GPTBot/ {print $9}' access.log | sort | uniq -c | sort -rn
```

Aradığınız şeyler:

1. **Her ajan için sıfırdan farklı bir hacim.** Herkese açık bir katalogda 72 saat boyunca hiçbir yapay zeka ajanından istek gelmemesi, popüler olmadığınız değil, yukarı akışta engellendiğiniz anlamına gelir.
2. **2xx ağırlıklı bir durum dağılımı.** Bir 403 duvarı, WAF'ın robots.txt'i geçersiz kıldığını gösterir. Bir 404 duvarı, site haritanızın ya da iç bağlantılarınızın artık var olmayan URL'lere işaret ettiği anlamına gelir.
3. **Yalnızca ürün yollarının değil, doküman yollarının da görünmesi.** `/datasheets/` hiç görünmüyorsa teknik kütüphaneniz görünmez demektir.
4. **Mantıklı yanıt boyutları.** Ürün URL'lerinde tekrarlayan 4–15 KB'lık 200 yanıtları genellikle tarayıcıların boş, istemci tarafında render edilen bir kabuk aldığı anlamına gelir — teknik olarak izinli, pratikte işe yaramaz.
5. **Kullanıcı tetiklemeli ajanların hiç değilse görünmesi.** ChatGPT-User, Claude-User ve Perplexity-User trafiği, alıcı ilgisine dair elinizdeki gerçek zamanlıya en yakın sinyaldir. Ayrıca raporlanmaya değer.

## Sık yapılan hatalar

- Eğitim tarayıcılarını hedefleyen genel bir kuralla, kullanıcı tetiklemeli getiricileri kazara engellemek.
- robots.txt'i doğru ayarlayıp WAF'a hiç dokunmamak. Bunlar iki ayrı anahtardır ve ikisinin de ayarlanması gerekir.
- RFC 9309 kapsamında her biri ayrı birer origin olan dokümantasyon alt alan adını, DAM'i ve CDN'i unutmak.
- Tarayıcıları CSS ve JavaScript varlıklarından engellemek. Yalnızca metin işleyen tarayıcılar için fark etmez, ama Googlebot da Applebot da render eder; onları varlıklardan mahrum bırakmak gördüklerini bozar.
- Bir toplayıcının verinizi doğru taşıdığını varsaymak. O, ne zaman kazıdıysa onu taşır.
- `llms.txt`'i bir ikame olarak görmek. Hiçbir büyük operatör onu okumayı taahhüt etmedi ve loglar genellikle bu dosyanın hiç istenmediğini gösteriyor.

Partsgraph, Ağustos 2026'da Kuzey Amerika, Avrupa ve Asya'da olmak üzere dünya genelinde 984 distribütör ve üretici alan adını denetledi. Yalnızca %19'u herhangi bir açık yapay zeka tarayıcı politikası yayımlamıştı — ve yayımlayanlar arasında büyük bir yapay zeka tarayıcısını engelleyenlerin sayısı, davet edenlerin iki katından fazlaydı. Hiçbiri bir MCP uç noktası duyurmuyordu. Medyan yapay zeka görünürlük puanı: 100 üzerinden 50. Bu açık henüz rekabet konusu değil — iyi kurgulanmış bir robots.txt'in, bir ürün verisi ekibinin harcayabileceği en yüksek kaldıraçlı saatlerden biri olmaya devam etmesinin nedeni de tam olarak bu.

*Yapay zeka tarayıcılarının alan adınızda gerçekte neye erişebildiğini ücretsiz Partsgraph derecelendiricisiyle [/audit](/audit) adresinden kontrol edin.*

## Sık sorulan sorular

### GPTBot ile ChatGPT-User arasındaki fark nedir?

GPTBot, OpenAI'ın temel modelleri için eğitim verisi toplayan toplu bir tarayıcıdır ve robots.txt'e uyar. ChatGPT-User ise birisi ChatGPT'ye o sayfayı gerektiren bir soru sorduğu için tek bir sayfayı getirir. OpenAI'ın dokümantasyonu, bu eylemler bir kullanıcı tarafından başlatıldığından robots.txt kurallarının geçerli olmayabileceğini belirtir. GPTBot'u engellemek bir lisanslama kararıdır; ChatGPT-User'ı engellemek, canlı bir müşterinin sorusunu yanıtsız bırakmaktır.

### Google-Extended bir tarayıcı mıdır?

Hayır. Google-Extended bir getirici değil, robots.txt içinde kullanılan bir denetim token'ıdır. Baytlar yine Googlebot üzerinden gelir. Google-Extended'a Disallow uygulamak, Google'a içeriği Gemini modellerini eğitmek ya da yanıtlarını temellendirmek için kullanmamasını söyler; normal Arama indekslemesi ise olduğu gibi kalır. Applebot-Extended, Apple tarafında aynı şekilde çalışır.

### Yapay zeka eğitim tarayıcılarını engellemek kataloğumu yapay zeka modellerinin dışında tutar mı?

Büyük ölçüde hayır ve üstelik size görünürlük kaybettirir. Komponent verisi distribütörler, toplayıcılar ve Common Crawl arasında kopyalanır; dolayısıyla içerik genellikle yine de modellere ulaşır — ama sizin güncel ve yetkili sürümünüz olarak değil, bir üçüncü tarafın bayatlamış kopyası olarak. Anlamlı bir denetim kazanmadan, alıntılanan kaynak olma imkânınızı kaybedersiniz.

### Ana alan adımdaki robots.txt, dokümantasyon alt alan adımı da kapsar mı?

Hayır. RFC 9309 uyarınca robots.txt tek bir origin ile sınırlıdır: şema, ana bilgisayar ve port. CDN ana bilgisayar adınızın, DAM'inizin ve dokümantasyon alt alan adınızın her birinin kendi dosyasına ihtiyacı vardır. robots.txt'te açık görünen bir sitenin bir tarayıcıya hiçbir şey sunmamasının en yaygın nedeni tam olarak budur.

### robots.txt dosyam Allow dediği hâlde tarayıcılar neden engelleniyor?

Çünkü robots.txt bir ricadır, uygulamayı yapan ise WAF'ınızdır. Bot yöneticileri sınıflandırmayı user-agent dizesine göre değil, doğrulanmış kaynak IP'ye göre yapar ve birçok varsayılan kural, web tarayıcısı olmayan her şeye challenge uygular. Doğrulanmış tarayıcı IP aralıklarına robots.txt'te izin vermenin yanı sıra onları kenar katmanında da izin listesine almanız gerekir.

### Bunun yerine llms.txt kullanmalı mıyım?

Bunun yerine değil. 2026 itibarıyla hiçbir büyük yapay zeka operatörü llms.txt'i okumayı taahhüt etmedi ve Google'ın Search Relations ekibi bunu desteklemekten kaçındı. Sunucu logları genellikle yapay zeka tarayıcılarının bu dosyayı hiç istemediğini gösteriyor. İsterseniz yayımlayın; ama davranışı gerçekten değiştiren şeyler robots.txt, gerçekten bağlantı verilmiş sayfalar ve doğrulanmış botlar için tutulan izin listesidir.

### Bir isteğin gerçekten GPTBot'tan geldiğini, sahtecilik olmadığını nasıl doğrularım?

Kaynak IP'yi, OpenAI'ın openai.com/gptbot.json adresinde yayımladığı önek listesiyle karşılaştırın. Her büyük operatör eşdeğer bir JSON dosyası yayımlıyor, Google ise ters DNS doğrulamasını destekliyor. Yalnızca user-agent dizesine asla güvenmeyin — taklit edilmesi çok kolaydır ve yapay zeka tarayıcısı olduğunu iddia eden trafiğin büyük bir kısmı gerçek değildir.

## Kaynaklar

1. [OpenAI, Overview of OpenAI crawlers](https://developers.openai.com/api/docs/bots)
2. [Anthropic, Does Anthropic crawl data from the web?](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler)
3. [Perplexity, PerplexityBot and Perplexity-User documentation](https://docs.perplexity.ai/guides/bots)
4. [Google Search Central, Google crawlers and user agents](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)
5. [Google Search Central, user-triggered fetchers](https://developers.google.com/search/docs/crawling-indexing/google-user-triggered-fetchers)
6. [Apple Support, About Applebot](https://support.apple.com/en-us/119829)
7. [Amazon, About Amazonbot](https://developer.amazon.com/amazonbot)
8. [Meta for Developers, Meta web crawlers](https://developers.facebook.com/documentation/sharing/webmasters/web-crawlers)
9. [Cloudflare, Content Independence Day: new AI traffic options, July 2026](https://blog.cloudflare.com/content-independence-day-ai-options/)
10. [Cloudflare, Content Signals Policy, September 2025](https://blog.cloudflare.com/content-signals-policy/)
11. [Cloudflare press release, blocking AI crawlers by default, July 2025](https://www.cloudflare.com/press/press-releases/2025/cloudflare-just-changed-how-ai-crawlers-scrape-the-internet-at-large/)
12. [RFC 9309, Robots Exclusion Protocol](https://www.rfc-editor.org/rfc/rfc9309.html)
13. [Forrester, The State Of Business Buying, 2026 (January 2026)](https://www.forrester.com/blogs/state-of-business-buying-2026/)

## Other languages

- English: https://partsgraph.ai/blog/robots-txt-for-ai-crawlers-guide/md
- Deutsch: https://partsgraph.ai/de/blog/robots-txt-for-ai-crawlers-guide/md
- Français: https://partsgraph.ai/fr/blog/robots-txt-for-ai-crawlers-guide/md
- Español: https://partsgraph.ai/es/blog/robots-txt-for-ai-crawlers-guide/md
- Italiano: https://partsgraph.ai/it/blog/robots-txt-for-ai-crawlers-guide/md
- Nederlands: https://partsgraph.ai/nl/blog/robots-txt-for-ai-crawlers-guide/md
- Polski: https://partsgraph.ai/pl/blog/robots-txt-for-ai-crawlers-guide/md
- Português: https://partsgraph.ai/pt/blog/robots-txt-for-ai-crawlers-guide/md
- Svenska: https://partsgraph.ai/sv/blog/robots-txt-for-ai-crawlers-guide/md
- 日本語: https://partsgraph.ai/ja/blog/robots-txt-for-ai-crawlers-guide/md
- 한국어: https://partsgraph.ai/ko/blog/robots-txt-for-ai-crawlers-guide/md
- 简体中文: https://partsgraph.ai/zh/blog/robots-txt-for-ai-crawlers-guide/md

---

Partsgraph — the agent-ready parts data layer. Free AI-visibility grader: https://partsgraph.ai/tr/audit
