Yapay zeka veri sayfalarınızı neden okuyamıyor
Kısaca
Yapay zeka asistanları ürün veri sayfalarımı neden okuyamıyor?
Veri sayfalarını yapay zeka açısından bozan dört şey var: PDF dosyası, bir tarayıcı onu çekemeden bir bot duvarı ya da oturum açma ekranı tarafından engelleniyordur; dosya, metin katmanı olmayan salt görüntü bir taramadır, dolayısıyla metin çıkarma sıfır karakter döndürür; belge, doğrudan dosya URL adresi bulunmayan bir JavaScript görüntüleyicisinin içine hapsolmuştur; ya da kendi robots.txt dosyası hayır diyen ayrı bir dokümantasyon sunucusunda durmaktadır. Bunlardan herhangi biri, parçanızın kesin teknik şartnamesini erişilemez kılar; şartnamenin gerçekten yaşadığı yer ise veri sayfasıdır — web sayfası her zaman yalnızca bir özet taşır.
Kısa cevap
Bir veri sayfası yapay zekaya dört şekilde görünmez hale gelir ve hepsi de son derece sıradan. Dosya, daha çekilmeden önce bir bot kuralı, bir oturum açma ekranı ya da bir ara sayfa tarafından engelleniyordur. Dosya, metin katmanı bulunmayan taranmış bir görüntüdür; bu yüzden metin çıkarıcı sıfır karakter elde eder. Belgeye yalnızca, doğrudan adresi olmayan bir JavaScript görüntüleyicisi üzerinden ulaşılabiliyordur. Ya da PDF dosyası ayrı bir doküman sunucusunda durur — docs., media., bir DAM, bir CDN — ve ana siteniz ne kadar açık olursa olsun, o sunucunun kendi robots.txt dosyası ya da WAF katmanı hayır der.
- Blocked before fetch
- A bot rule, a login or an interstitial. Zero bytes retrieved.
- Scanned image, no text layer
- The extractor pulls out zero characters. The page is there; the words are not.
- JavaScript viewer only
- No direct URL to the file, so nothing to fetch.
- Separate documentation host
- docs., media., a DAM or CDN with its own robots.txt or WAF saying no.
Bunların hiçbiri egzotik değil. Dördü de yaygın ve herhangi biri tek başına yeterli. Sonucu açıkça söylemekte fayda var:
Esas alınan teknik şartname veri sayfasıdır. Ürün sayfası ise onun bir özetidir. Yapay zeka özeti okuyup kaynağı okuyamadığında, mühendislik sorularını özetten yanıtlar — ve yanlış yanıtlar.
Burada veri sayfaları neden web sayfalarından daha önemli
Bir ürün sayfası olsa olsa sekiz ila yirmi öznitelik taşır: kılıf, temel değer, yaşam döngüsü etiketi, fiyat, stok. Bir veri sayfası ise yüzlercesini taşır: mutlak maksimum değerler, sıcaklığa göre elektriksel karakteristikler, zamanlama diyagramları, pin açıklamaları, termal direnç değerleri, önerilen ayak izleri, nem hassasiyet seviyesi, sipariş kodu çözümleme tabloları. Bir mühendisin bir asistana gerçekten sorduğu hemen her soru — bunu 5,5 V'ta çalıştırabilir miyim, 85 derecede boşta çekilen akım nedir, pin dizilimi değiştirmekte olduğum parçayla uyumlu mu — veri sayfasında yanıtlanır, başka hiçbir yerde değil.
Bu, eskiye kıyasla artık daha da önemli; çünkü sorular sizin arama kutunuza yazılmak yerine asistanlara soruluyor. Forrester, Ocak 2026'da kurumsal alıcıların %94'ünün satın alma sürecinde artık yapay zeka kullandığını ortaya koydu. Üstelik en derin teknik içeriği taşıyan sayfalar, en kötü performans gösterenler: Adobe'nin Nisan 2026 tarihli perakende makine okunabilirliği analizi, ürün detay sayfalarını %66 ile tüm sayfa türleri içindeki en düşük seviyede puanladı; %75'lik ana sayfaların ve %80'lik SSS sayfalarının altında.
Temeldeki veriye erişilemediğinde ortaya çıkan sonuç sessizlik değil, kendinden emin hatadır. OpenAI, Mart 2026'da ChatGPT içindeki Instant Checkout özelliğini yaklaşık 30 satıcı canlıdayken kapattı ve bunun temel nedenlerinden biri hatalı ürün verisiydi: OpenAI ürün bilgisi için perakende sitelerini kazıyordu ve stok, kargo ve fiyat verileri sık sık yanlış çıkıyordu. Bu, yanlış bir maksimum değerle aynı hata biçimidir; sadece riski daha düşüktür.
Bir veri sayfasının okunamaz hale gelmesinin beş yolu
| Hata | Tarayıcının gördüğü | Nasıl fark edilir |
|---|---|---|
| Bot duvarı | PDF yerine 403, 429 ya da bir HTML doğrulama sayfası | Yanıttaki content-type, application/pdf değil text/html |
| Salt görüntü tarama | Çıkarılabilir metin içermeyen geçerli bir PDF dosyası | Metin çıkarma 0 karakter döndürür; gömülü yazı tipi yoktur |
| Yalnızca görüntüleyicide açılan belge | Dosya adresi olmayan bir JavaScript sayfası | PDF dosyası bir blob'dan ya da kimlik doğrulamalı bir akıştan yüklenir |
| Ayrı sunucu politikası | Ürün sayfasında temiz bir 200, belgede engel | Doküman sunucusunun kendi robots.txt dosyası ve WAF katmanı vardır |
| Geçici ya da kapı arkasındaki adres | Süresi dolan imzalı bir bağlantı ya da bir form kapısı | Bağlantı web tarayıcınızda çalışır, curl ile 403 verir |
Beşincisi, en çok kendi elimizle yarattığımız sorundur. Kısa ömürlü imzalı adresler, "indirmek için kayıt olun" kapıları ve tek kullanımlık token'lar birer görünmez duvardır: bir tarayıcının oturumu, çerezi ve form doldurma davranışı yoktur. Ayrıca yapay zeka tarayıcıları JavaScript çalıştırmadığı için, DOM ağacına bir script tarafından yazılan her indirme bağlantısı onların tarafında hiç var olmaz.
Veri sayfalarımın okunabilir olup olmadığını nasıl kontrol ederim?
Üç komut meseleyi çözer. Bunları kendi belgelerinize karşı çalıştırın.
- 01Çekimi kontrol edin. Adres, web tarayıcısı olmayan sıradan bir istemciye bir PDF dosyası döndürüyor mu?
curl -sSIL "https://example.com/datasheets/part-12345.pdf" | grep -iE "^HTTP|content-type|content-length"Sonuçta bir 200 ve content-type: application/pdf görmek istersiniz. content-type: text/html ise, size indirme kılığında bir doğrulama ya da oturum açma sayfası verilmiş demektir.
- 01İndirin ve gerçekten bir PDF dosyası olduğunu doğrulayın.
curl -sSL -o ds.pdf "https://example.com/datasheets/part-12345.pdf" -w "status=%{http_code} type=%{content_type} bytes=%{size_download}"
head -c 5 ds.pdfİlk beş bayt %PDF- olmalıdır. <!DOC ise bir hata sayfası indirmişsinizdir.
- 01Metin katmanını test edin. Kimsenin çalıştırmadığı komut bu.
pdftotext -q ds.pdf - | tr -d '[:space:]' | wc -c
pdffonts ds.pdfBir PDF dosyasının metin katmanı olup olmadığını nasıl anlarım?
İki sayı yeter ve aralarındaki uçurum tartışmasızdır. Her iki testi de gerçek ve güncel bir üretici veri sayfasına — Texas Instruments'ın LM358 parçası, 4,15 MB'lık bir PDF dosyası — ve aynı belgenin rasterleştirilmiş bir kopyasına karşı çalıştırdık; o kopya, taranmış eski bir veri sayfasının bir makineye tam olarak nasıl göründüğünü gösteriyor.
| Test | Gerçek veri sayfası | Salt görüntü tarama |
|---|---|---|
pdftotext ile çıkarılan karakter sayısı | 95.895 | 0 |
pdffonts gömülü yazı tipi satırı sayısı | 114 | 0 |
| İnsan gözüyle birebir aynı | Evet | Evet |
| Yapay zeka asistanının kullanabilmesi | Evet | Hayır |
Teşhisin tamamı bu. Sıfır çıkarılabilir karakter ve sıfır gömülü yazı tipi, dosyada metin olmadığı anlamına gelir — yalnızca metnin bir resmi vardır. Belge bir insan için kusursuz görüntülenir ve bir modele kelimenin tam anlamıyla hiçbir şey katmaz. Hâlâ üretimde olan bir parçanın taranmış 1990'lar veri sayfası, internetteki her yapay zeka sistemi için boş bir sayfadır.
Bilmeye değer iki ayrıntı daha var. Düşük ama sıfır olmayan bir karakter sayısı — diyelim kırk sayfalık bir belgede birkaç yüz karakter — genellikle metin başlıklı ama taranmış gövdeli bir belgeye işaret eder ki bu da aynı ölçüde kullanılamaz. Bir de pdffonts çıktısındaki uni sütunu önemlidir: ToUnicode eşlemesi olmadan altkümelenmiş yazı tipleri, karakterler teknik olarak mevcut olsa bile bozuk karakter (mojibake) olarak çıkarılabilir. Yalnızca sayıya güvenmek yerine, çıkarılan metnin ilk 200 karakterini gözle kontrol edin.
Tüm bir kütüphaneyi taramak için döngüye alın:
while read -r url; do
code=$(curl -sSL -o /tmp/d.pdf -w "%{http_code}" --max-time 30 "$url")
chars=$(pdftotext -q /tmp/d.pdf - 2>/dev/null | tr -d '[:space:]' | wc -c)
echo "$code $chars $url"
done < datasheet-urls.txtÇıktıyı karakter sayısına göre artan biçimde sıralayın. O listenin en üstündeki her şey, ürün verinizdeki bir boşluktur.
Ayrı sunucu tuzağı
Bu tuzak, büyük kuruluşların neredeyse istisnasız hepsini yakalar; çünkü işleri düzgün yapmanın bir sonucudur. Belgeler bir DAM sistemine, bir dokümantasyon alt alan adına ya da bir CDN üzerine taşınır; bunların her biri kendi yapılandırması — ve çoğu zaman kendi sahibi — olan ayrı bir kaynaktır.
RFC 9309 uyarınca robots.txt dosyasının kapsamı tek bir kaynakla sınırlıdır: şema, sunucu adı ve port. https://www.example.com/robots.txt, https://docs.example.com/ üzerinde de https://cdn.example-media.net/ üzerinde de hiçbir şeyi yönetmez. Ana siteniz yapay zeka tarayıcılarını memnuniyetle karşılıyorsa ama doküman sunucunuz baştan sona Disallow: / içeren varsayılan bir şablonla ayağa kaldırıldıysa ya da insan olmayan her şeyi doğrulamaya sokacak biçimde yapılandırılmış bir bot yöneticisinin arkasındaysa, pazarlama siteniz ardına kadar açıkken tüm teknik kütüphaneniz karanlıkta demektir.
Belge sunan her kaynağı kontrol edin:
for h in www.example.com docs.example.com cdn.example-media.net; do
echo "--- $h"
curl -sS --max-time 15 "https://$h/robots.txt" | head -30
doneİyi olan neye benzer
Doğru yayımlanmış bir veri sayfasında dikkat çekici hiçbir şey yoktur; zaten mesele de budur. Texas Instruments, LM358 veri sayfasını /lit/ds/ altında sabit ve tahmin edilebilir bir adreste sunar; robots.txt dosyası bu yola hiçbir kısıtlama getirmez; dosya, kendisini GPTBot olarak tanıtan ve web tarayıcısı olmayan bir istemciye content-type: application/pdf ile 200 döndürür; PDF dosyası ise gömülü ve Unicode eşlemeli yazı tipleriyle eksiksiz bir metin katmanı taşır. Oturum açma yok, görüntüleyici yok, imzalı adres yok, ara sayfa yok. Dünyadaki her metin çıkarma hattı onu okuyabilir.
Bileşen sektöründeki gidişat, bunu daha da kolaylaştırma yönünde. Microchip, Kasım 2025'te ürün verisi — teknik özellikler, veri sayfaları, envanter, fiyatlandırma ve teslim süreleri — için ücretsiz ve kimlik doğrulaması gerektirmeyen bir MCP sunucusu yayımladı; ECIA bünyesindeki TrustedParts ise Haziran 2026'da, yetkili distribütör stok durumunu Copilot, ChatGPT ve Claude için erişilebilir kılan bir envanter yapay zeka ajanı servisi başlattı. İkisi de aynı gerçeğin kabulü: bir makinenin uğruna mücadele etmek zorunda kaldığı belge, kaybeden belgedir.
Bunu nasıl düzeltirsiniz?
Efora göre getiri sırasıyla:
- 01Belge yollarındaki engelleri kaldırın.
/datasheets/*,/lit/*,/documents/*ve muadili yollarda yapay zeka tarayıcılarına, yalnızca robots.txt dosyasında değil WAF katmanında da izin verin. Bunlar iki ayrı anahtardır ve ikisinin de açık olması gerekir. - 02Herkese açık teknik belgelerden indirme kapılarını kaldırın. Bir veri sayfası herkese açık sitenizdeyse, o zaten kamuya açıktır. Bir kayıt formu yalnızca sizi önerecek olan makineleri durdurur.
- 03Salt görüntü olan her PDF dosyasını OCR ile işleyin ve metin katmanıyla yeniden yayımlayın. Önceliği belgenin yaşına göre değil, parçanın cirosuna göre belirleyin. Temiz bir 300 dpi taramada modern OCR, gövde metninde kayıpsıza yakındır; parametre tablolarını elle doğrulayın.
- 04Her belgeye sabit, doğrudan ve bağlantı verilebilir bir adres verin. Blob yok, görüntüleyici yok, süresi dolan token yok,
?token=sorgu dizesi yok. - 05Her veri sayfasının HTML ya da markdown ikizini yayımlayın. Teknik özellik tabloları gerçek tablolar olsun. Tek başına en etkili değişiklik budur; çünkü PDF sayfa düzeni sezgisellerine olan tüm bağımlılığı ortadan kaldırır ve size doğruluk açısından izleyebileceğiniz bir sayfa kazandırır.
- 06Belgeyi, ürün sayfasından sunucuda oluşturulan HTML içinde çapraz bağlayın; böylece sayfaya ulaşan bir tarayıcı, hiçbir şey çalıştırmadan belgeye de ulaşabilir.
- 07Çıkarılan parametreleri yapılandırılmış veri olarak sunun — sayfada JSON-LD biçiminde ve ideal olarak sorgulanabilir bir uç nokta üzerinden — böylece bir ajan, her seferinde bir PDF dosyasını yeniden ayrıştırmak yerine bunlar üzerinde filtreleme yapabilir.
Partsgraph, Ağustos 2026'da dünya genelinde — Kuzey Amerika, Avrupa ve Asya'da — 984 distribütör ve üretici alan adını denetledi. Medyan yapay zeka görünürlük puanı 100 üzerinden 50 çıktı ve kohortun %70'i D ya da F aldı. Puanın istikrarlı biçimde en zayıf bileşeni belge katmanıydı: %38'i, web tarayıcısı olmayan standart bir istemciye tek bir okunabilir katalog sayfası bile veremedi ve belgeye erişim, sayfaya erişimden daha sık başarısız oldu.
İşin rahatsız edici yanı, bunların hiçbirinin analitiğinize yansımaması. Engellenen bir tarayıcı hata kaydı açmaz, kötü bir OCR istisna fırlatmaz ve veri sayfanızı okuyamayan bir model, alıcıya veri sayfanızı okuyamadığını söylemez. Yalnızca, PDF dosyası açılan bir rakibi önerir.
Kendi belge kütüphanenizi bu testlere karşı, ücretsiz Partsgraph yapay zeka görünürlük puanlayıcısıyla [/audit](/audit) adresinde kontrol edebilirsiniz.
Sık sorulan sorular
Yapay zeka tarayıcıları PDF dosyalarını okuyabiliyor mu?
Onları çekebiliyorlar ve PDF metin çıkarma, veri alma hatlarının standart bir parçası. Yapamadıkları şey, dosyada olmayan bir metni uydurmak. Çıkarma işlemi metin katmanını okur; PDF dosyası metin katmanı bulunmayan taranmış bir görüntüyse, çıkarma hiçbir şey döndürmez ve belge de hiçbir katkı sağlamaz.
Bir PDF dosyasının metin katmanı olup olmadığını nasıl anlarım?
Dosyaya karşı pdftotext çalıştırıp döndürdüğü karakter sayısını sayın, ardından pdffonts çalıştırıp satırları sayın. Sağlıklı bir veri sayfası on binlerce karakter ve uzun bir gömülü yazı tipi listesi döndürür. Salt görüntü bir tarama ise sıfır karakter ve sıfır yazı tipi döndürür.
Veri sayfalarım ayrı bir dokümantasyon alt alan adında duruyor. Bunun bir önemi var mı?
Evet. RFC 9309 uyarınca robots.txt dosyasının kapsamı tek bir kaynakla sınırlıdır — şema, sunucu adı ve port. www.example.com üzerindeki izin verici bir robots.txt dosyası, docs.example.com üzerinde ya da CDN sunucu adınızda hiçbir izin vermez. Belge sunan her kaynağın kendi politikasına ihtiyacı vardır ve her biri WAF kurallarınıza ayrı ayrı tabidir.
Veri sayfası içeriğini web sayfasına HTML olarak koymalı mıyım?
Evet ve bu genellikle getirisi en yüksek düzeltmedir. Her veri sayfasının HTML ya da markdown ikizi — teknik özellik tabloları, mutlak maksimum değerler, pin açıklamaları, sipariş bilgileri — son derece kolay ayrıştırılır, önbelleğe alınabilir ve kaynak gösterilebilir; ayrıca bir PDF metin çıkarıcısının sizin sayfa düzeninizle ne kadar iyi başa çıktığına dair her türlü bağımlılığı ortadan kaldırır.
Doküman sunucumda botları engellemek fikri mülkiyetimi korur mu?
Daha çok sizi önerilmekten korur. Veri sayfaları zaten toplayıcılar arasında çoğaltılmış durumda; dolayısıyla tarayıcıyı engellemek içeriği eğitim derleminden nadiren çıkarır. Bunun tek sonucu, modelin gördüğü sürümün sizin güncel revizyonunuz değil, üçüncü bir tarafın bayat kopyası olmasıdır. Amaç kontrolse, esas alınacak belgeyi kendiniz sunun ve doğruluğunu izleyin.
Çok sütunlu sayfa düzenleri ve tablolar metin çıkarma işleminden sağ çıkar mı?
Kusurlu biçimde. İki sütunlu veri sayfası düzenleri doğrusal olarak çıkarıldığında sık sık iç içe geçer, birleştirilmiş hücreli parametre tabloları da satır yapısını kaybeder. Doğru okuma sırasına sahip etiketli PDF dosyaları epey yardımcı olur, ama aynı tabloların HTML ya da markdown kopyası belirsizliği tümüyle ortadan kaldırır.
Kaç veri sayfasını test etmeliyim?
Önce trafiğe göre ilk 20'nizi test edin, ardından tüm kütüphaneyi bir script ile tarayın. Deneyimimize göre hatalar belgenin yaşına ve hazırlandığı yazılıma göre kümeleniyor; bu yüzden yalnızca yeni parçaları kapsayan bir örneklem, kütüphanenin gerçekte olduğundan çok daha sağlıklı görünür.
Kaynaklar
- 01Adobe Digital Insights, AI traffic and retail machine-readability, April 2026
- 02eCommerceNews, Adobe machine-readability scores by page type, April 2026
- 03CNBC, OpenAI revamps shopping in ChatGPT after Instant Checkout, March 2026
- 04Forrester, The State Of Business Buying, 2026 (January 2026)
- 05Vercel and MERJ, The rise of the AI crawler, December 2024
- 06RFC 9309, Robots Exclusion Protocol
- 07Microchip Technology, MCP Server press release, November 2025
- 08ECIA, TrustedParts.com launches Inventory AI Agent Service, June 2026
- 09Texas Instruments, LM358 datasheet (used as a worked example)
Yapay zeka asistanlarının bugün ürünlerinizde tam olarak neleri okuyup neleri okuyamadığını görün — tarayıcı politikası, katalog kapsamı, teknik doküman erişimi — puanlanmış ve dünya genelindeki 984 distribütör ve üreticiyle kıyaslanmış olarak.
Kataloğumu puanlaİlgili saha notları
Yapay zeka tarayıcıları JavaScript çalıştırmaz
GPTBot, ClaudeBot ve PerplexityBot ham HTML okur, script çalıştırmaz. Kataloğunuz görünür mü, nasıl test edili…
TeknikÜreticiler için MCP: pratik bir rehber
Model Context Protocol nedir, bir parça MCP sunucusu neleri sunmalı, OAuth fiyat ve stoku nasıl korur ve hangi…
UyumlulukDijital Ürün Pasaportu: ETIM alanlarına eşleştirme
DPP makine tarafından okunabilir veri istiyor ama sözlük adı vermiyor. Her gereklilik ETIM yapısına eşlendi: ö…