“Yapay zekâ tarayıcısı” ifadesinin içinde, birini engellemenin mantıklı bir iş kararı mı yoksa pahalı bir kaza mı olduğunu belirleyen bir ayrım var — ve robots.txt hakkında yazılanların neredeyse hiçbiri bu ayrımı yapmıyor. Aynı şirketin iki tarayıcısı sizden tamamen farklı şeyler isteyebilir.
İki tür, ve neden önemli
Eğitim tarayıcıları model eğitmek için metin toplar. Ziyaretleri size bugün hiçbir şey getirmez. Bunları reddetmek meşru bir karardır, birçok yayıncı bilinçli olarak yapar ve kimse size bunun yanlış olduğunu söyleyemez.
Cevap motorları ise türsel olarak farklıdır. Sayfanızı tam olarak bir insan soru sorduğu anda çeker; böylece asistan güncel bir şeyden cevap verebilir ve kaynağını söyleyebilir. O çekme işlemi, adınızın ve bağlantınızın cevapta görünmesini sağlayan mekanizmanın kendisidir. Bunu engellemek içeriğinizin öğrenilmesini engellemez — sizi, size bağlantı verecek olan sonuçların dışına çıkarır.
İkisi çoğu zaman aynı şirkete ait, hiçbir zaman aynı amaca değil. GPTBot OpenAI’ın eğitim tarayıcısıdır; OAI-SearchBot ChatGPT aramasının kullandığıdır. ClaudeBot ve Claude-SearchBot aynı şekilde ayrılır. “Yapay zekâ botlarını” hedefleyen bir kural genellikle ikisini birden vurur.
| Tarayıcı | İşletmeci | Ne için |
|---|---|---|
OAI-SearchBot | OpenAI | ChatGPT araması için çeker. Size trafik gönderir. |
ChatGPT-User | OpenAI | Bir kullanıcı o anda sorduğu için sayfayı çeker. |
GPTBot | OpenAI | Eğitim verisi toplar. Bugün size bir şey getirmez. |
Claude-SearchBot | Anthropic | Arama ve kaynak gösterme için çeker. |
ClaudeBot | Anthropic | Eğitim verisi toplar. |
PerplexityBot | Perplexity | Kaynak gösteren bir cevap motoru için dizinler. |
Google-Extended | Gemini eğitim kullanımını yönetir. Arama’yı etkilemez. |
Google-Extended, insanların ters yönde yanlış anladığı tanesi. Kendi kullanıcı ajanı olan bir tarayıcı değil — Google’ın zaten taradığı içeriği Gemini eğitiminde kullanıp kullanamayacağını belirleyen bir işaret. Bunu engellemek sizi Google aramasından çıkarmaz.
Gerçekte kaç site bunları engelliyor
293 tanınmış sitenin robots.txt dosyasını, 2026-09-03 tarihinde, her tarayıcı için tek tek çözümledik. İlginç olan sayı, kaç sitenin eğitim tarayıcılarını engellediği değil — o bir tercih. İlginç olan, kaç sitenin kendisine müşteri gönderecek olanı engellediği.
| Tarayıcı | Engelleyen site | Oran |
|---|---|---|
GPTBot (eğitim) | 41 | 14% |
OAI-SearchBot (cevap) | 20 | 7% |
ClaudeBot (eğitim) | 43 | 15% |
PerplexityBot (cevap) | 36 | 12% |
Google-Extended (eğitim) | 37 | 13% |
Bu iki çifti birbirine karşı okuyun. Cevap motoru sayısı eğitim sayısına yaklaştığı yerde, o siteler iki karar vermemiş — her şeyi yakalayan tek bir kuralla tek karar vermiş.
Kuralları bilinçli yazmak
Tutumunuz “benden öğren, ama insanları bana geri gönderiyorsan” ise, dosya bunu açıkça söylemeli. Her tarayıcıyı adıyla yazın; joker karaktere güvenmeyin.
# Cevap motorları: izinli, çünkü bize insan gönderiyorlar.
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
# Eğitim tarayıcıları: izinli değil.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xml
Bu dosyaların gerçekte nasıl değerlendirildiği hakkında bilinmesi gereken iki şey. Bir tarayıcı kendisini adıyla anan en özel gruba uyar; yani dosyanın herhangi bir yerinde bir GPTBot grubu varsa, User-agent: * bloğu GPTBot için geçerli değildir. Ve boş bir Disallow: satırı her şeye izin ver demektir — Disallow: / yazmanın yazım hatası değildir, ve bu iki satır arasındaki fark politikanızın tamamıdır.
Onları uzaklaştıran tek şey robots.txt değil
İzin veren bir robots.txt tek başına hiçbir şey kanıtlamaz. CDN katmanındaki bot koruma ürünleri, tarayıcı olmayan her şeye rutin olarak bir doğrulama sayfası döner; doğrulama alan bir tarayıcı hiçbir içerik almaz — sessizce, 200 durum koduyla, yani hiçbir yerde hata olarak kaydedilmez.
Bu örneklemde 45 of 293 (15%) site, dürüstçe kendini tanıtan sade bir HTTP isteğine sayfa yerine duvara benzeyen bir şey döndü. Bu sitelerin çoğunun robots.txt dosyası, sınırda geri çevirdiği tarayıcılara izin veriyor.
Kendi sitenizde ne kontrol etmeli
robots.txtdosyanızı her tarayıcı için tek tek çözümleyin, okuyup varsaymayın. Öncelik kuralları gözle yanılmayı kolaylaştırır.- Kendi sayfanızı tarayıcı olmayan bir kullanıcı ajanıyla çekin ve sayfa mı doğrulama mı geldiğine bakın.
- Eğitim sorusuna bilinçli karar verin ve gerekçesini bir sonraki kişinin görebileceği bir yere yazın.
- Her CDN veya bot koruma değişikliğinden sonra tekrar bakın. Bu, kapsamını bilmeyen biri tarafından sizin adınıza açılan ayardır.
Tarama, robots.txt dosyanızı adı geçen her yapay zekâ tarayıcısı için tek tek çözümler ve hangilerinin reddedildiğini, sayfanın kendisinin onlara cevap verip vermediğini söyler.