
Content Signals robots.txt dosyasına eklenen kullanım beyanıdır
Content Signals, bir sayfanın taranmasına izin verilip verilmediğini değil, tarandıktan sonra hangi amaçla kullanılabileceğini bildiren bir robots.txt eklentisidir. Cloudflare tarafından yayımlanmış, CC0 lisansıyla herkesin serbestçe uygulamasına açılmıştır. Dosyaya iki parça ekler: # ile başlayan ve sinyallerin anlamını insan diliyle tanımlayan yorum bloğu, bir de tercihleri makine okunur biçimde taşıyan Content-Signal satırı.
Bu ayrımın nedeni robots.txt'nin kendi sınırıdır. Robots Exclusion Protocol bir tarayıcının hangi yolu isteyebileceğini düzenler. İçerik indirildikten sonra bir arama indeksine mi gireceği, bir modelin eğitim setine mi ekleneceği, yoksa canlı bir yapay zeka cevabına girdi olarak mı kullanılacağı robots.txt'nin cevapladığı bir soru değildir. Erişim izni ile kullanım izni farklı iki karardır ve klasik robots.txt yalnız birincisini ifade eder.
Cloudflare, yönetilen robots.txt özelliği açık olan alan adlarında bu politikayı otomatik olarak servis eder. Cloudflare kurulumu tamamlanmış bir sitede ayar panelden açılır, dosyanın kendisi sunucuya yazılmaz. Cloudflare kullanmayan bir site de aynı metni kendi robots.txt dosyasına elle ekleyebilir, çünkü politika lisans olarak serbesttir.
Üç sinyalin tek tek anlamı
Politika üç kategori tanımlar ve her biri farklı bir teknik süreci karşılar. Kategorilerin sınırları politikanın kendi metninde açıkça çizilmiştir, özellikle de arama ile yapay zeka özetleri arasındaki sınır.
| Sinyal | Neyi kapsar | Neyi kapsamaz |
|---|---|---|
| search | Arama indeksi oluşturmak, sonuç sayfasında bağlantı ve kısa alıntı döndürmek | Yapay zeka üretimi arama özetleri |
| ai-input | İçeriği canlı olarak bir modele girdi vermek, RAG ve grounding gibi anlık kullanımlar | Modelin ağırlıklarını değiştiren eğitim süreci |
| ai-train | Model eğitmek veya mevcut bir modeli ince ayarlamak | Cevap üretilirken yapılan anlık içerik çekimi |
Kritik nokta search tanımının kendi içinde bir istisna taşımasıdır. Arama sinyali bağlantı ve kısa alıntı döndürmeyi kapsar, yapay zeka tarafından üretilen özetleri kapsamaz. Yani bir site sahibi aramaya evet, yapay zeka özetlerine hayır demek istiyorsa bunu search üzerinden değil ai-input üzerinden ifade eder.
Cloudflare bu üçlüye ek olarak use adında dördüncü ve opsiyonel bir alanı da deniyor. Bu alan içeriğin erişimden sonra ne kadar saklanıp yeniden kullanılabileceğini tarif eder ve üç değer alır: immediate yalnız anlık etkileşim ve hiçbir şey saklamama, reference indeksleme, alıntılama ve geri bağlantı verme, full özetleme ve yeniden üretme. Cloudflare'in yönetilen dosyasında varsayılan değer reference olarak servis ediliyor.
Sinyaller robots.txt içine nasıl yazılır?
Makine okunur kısım tek satırdır. Sözdizimi virgülle ayrılmış anahtar=değer çiftlerinden oluşur ve değer yalnız yes veya no olabilir.
User-agent: *
Content-Signal: search=yes, ai-train=no
Allow: /
Bir sinyalin hiç yazılmaması üçüncü bir durumdur ve boş bırakmak izin vermek anlamına gelmez. Politikanın kendi ifadesine göre, bir kullanım için sinyal belirtilmemişse site sahibi o kullanım hakkında bu mekanizmayla ne izin vermiş ne de kısıtlama getirmiş sayılır. Yukarıdaki örnekte ai-input yoktur, bu da o konuda tercih beyan edilmediği anlamına gelir.
Cloudflare'in yönetilen robots.txt özelliği açıldığında varsayılan olarak search=yes, ai-train=no, use=reference servis edilir. ai-input bilerek dışarıda bırakılır, çünkü Cloudflare müşterisinin o konudaki tercihini bilmediğini ve tahmin etmek istemediğini belirtir. Aynı yönetilen blok, bilinen eğitim tarayıcıları için ayrıca Disallow: / satırları ekler. Bu listede Amazonbot, Applebot-Extended, Bytespider, CCBot, ClaudeBot, Google-Extended, GPTBot ve meta-externalagent yer alır.
Dikkat edilmesi gereken ayrıntı şudur: sinyal satırı ile Disallow satırları aynı dosyada dursa da farklı işler yapar. Sinyal bir beyandır, Disallow ise bir erişim talebidir. robots.txt kurallarının tarama bütçesine etkisi tamamen ikinci gruba bağlıdır, sinyal satırının tarama davranışına doğrudan bir etkisi yoktur.
Sinyal teknik engel değil niyet beyanıdır
Cloudflare bunu açıkça söylüyor: içerik sinyalleri tercih ifade eder, kazımaya karşı teknik bir önlem değildir ve bazı şirketler bunları basitçe göz ardı edebilir. robots.txt'ye uyum zaten gönüllüdür, Content Signals bu gönüllülüğü değiştirmez.
Pratikte üç ayrı katman vardır ve karıştırıldığında yanlış beklenti doğar:
- Beyan katmanı.
Content-Signalsatırı. İçeriğin ne amaçla kullanılabileceğini bildirir, hiçbir isteği durdurmaz. - Talep katmanı.
AllowveDisallowsatırları. Uyan tarayıcıları yönlendirir, uymayanı durdurmaz. - Uygulama katmanı. WAF kuralları, bot yönetimi ve tarayıcı denetimi. İsteği gerçekten reddeden tek katman budur.
Politikanın hukuki tarafı da bu tabloya oturur. Metnin sonunda, sinyaller yoluyla ifade edilen kısıtlamaların Avrupa Birliği'nin dijital tek pazardaki telif hakları direktifinin dördüncü maddesi kapsamında açık bir hak saklı tutma beyanı olduğu belirtilir. Bu bir mahkeme kararı değil, site sahibinin tek taraflı bir kayıt düşmesidir. Böyle bir beyanın pratik sonucu ülkeye, uyuşmazlığın niteliğine ve ilgili yargı çevresine göre değişir, dolayısıyla bunu hukuki güvence olarak okumak doğru olmaz.
Sinyalleri bugün kim okuyor?
Bu, yazının en çok atlanan kısmı. Sinyalin tanımlı olması, tarayıcıların onu işlediği anlamına gelmiyor.
Google'ın açık kaynaklı robots.txt ayrıştırıcısında, tanınan fakat kullanılmayan etiketlerin tutulduğu bir liste var. content-signal ve content-usage bu listede yer alıyor. Kodun kendi yorum satırı da durumu net biçimde tarif ediyor: bunlar robots.txt dosyalarında yaygın görülen etiketlerdir, Google onları hiçbir şey için kullanmaz, ancak başka arama motorları kullanıyor olabilir. Google tarafından resmen desteklenen alanlar yalnız user-agent, allow, disallow ve sitemap'tir, tanınmayan satırlar sessizce yok sayılır.
Google'dan John Mueller da aynı yönde konuştu ve bildiği kadarıyla hiçbir tarayıcının veya dil modelinin bu direktifleri kullanmadığını, satırın robots.txt dosyasına yalnız şişkinlik ve bakım yükü eklediğini söyledi. Content Signals kabul edilmiş bir internet standardı değil, bir şirket tarafından yayımlanmış ve IETF'e bireysel taslak olarak sunulmuş bir öneri. Yapay zeka kullanım tercihlerinin standartlaşması çalışması IETF içinde ayrı bir çalışma grubunda kendi hattında ilerliyor.
Bu tablo sinyali değersiz yapmaz, ama beklentiyi doğru yere oturtur. Yapay zeka motorlarında görünürlük bugün sinyal satırıyla değil, içeriğin erişilebilirliği, kaynak kalitesi ve gerçek tarayıcı izinleriyle belirleniyor.
Arama taraması ile eğitim taraması ayrı süreçlerdir
Content Signals'ın çözmeye çalıştığı asıl kafa karışıklığı burada. Büyük yapay zeka sağlayıcılarının çoğu tek bot kullanmaz. Eğitim için ayrı, arama ve cevap üretimi için ayrı, kullanıcı isteğiyle yapılan anlık çekim için ayrı kullanıcı aracıları vardır ve bunların robots.txt izinleri birbirinden bağımsızdır.
| Sağlayıcı | Eğitim taraması | Arama ve cevap taraması | Kullanıcı isteğiyle çekim |
|---|---|---|---|
| Google-Extended | Googlebot | Ayrı bot yok | |
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
OpenAI kendi dokümantasyonunda ayrımı açıkça kuruyor: her ayar diğerinden bağımsızdır, bir site OAI-SearchBot'a izin verip GPTBot'u engelleyerek arama sonuçlarında görünmeye devam edebilir. OAI-SearchBot engellenen site ise ChatGPT'nin arama cevaplarında gösterilmez. Anthropic tarafında da eğitim botunu engellemek arama botunu engellemez.
Google tarafında ayrım biraz farklı işler. Google-Extended, Gemini modellerinin eğitimi ve Gemini uygulamalarındaki temellendirme için ayrı bir belirteçtir. Google, Google-Extended'in bir sitenin Google Arama'ya dahil olmasını etkilemediğini ve arama içinde sıralama sinyali olarak kullanılmadığını yazıyor. Buna karşılık AI Overviews ve AI Mode aramanın parçasıdır ve Googlebot ile taranır. Yani bu iki yüzeyi ayıran şey ayrı bir bot değil, snippet kontrolleridir.
Yanlış yapılandırma arama görünürlüğünü nasıl bozar?
Sinyal satırının kendisi yok sayıldığı için zarar vermez. Zarar, sinyalin yanına yazılan erişim kurallarından çıkar. Dört senaryo sahada sürekli tekrarlanıyor.
Tüm botlara kapatıp aramaya açık kaldığını sanmak
En pahalı hata bu. User-agent: * altına Disallow: / yazıp hemen altına Content-Signal: search=yes eklemek, aramaya izin vermez. Googlebot sinyal satırını okumaz, Disallow satırını okur. Sonuç, sitenin taranmayı durdurması ve zamanla arama sonuçlarından silinmesidir. Beyan ile talep aynı dosyada olsa da çelişkiyi tarayıcı çözmez, talebi uygular.
Yapay zeka özetlerinden kaçmak için Googlebot'u engellemek
AI Overviews'ta görünmek istemeyen bir site sahibi Googlebot'u engellediğinde AI Overviews'tan değil, aramanın tamamından çıkar. Google'ın kendi dokümantasyonu yapay zeka özelliklerinin aramanın içine gömülü olduğunu ve aynı tarama altyapısını kullandığını söylüyor. Doğru kontrol ayrı bir bot engeli değil, nosnippet, max-snippet ve data-nosnippet gibi önizleme kontrolleridir. Bu kontroller özet kullanımını kısıtlarken sayfanın indekste kalmasına izin verir.
Adında yapay zeka geçen her botu engellemek
Hazır engelleme listeleri çoğu zaman eğitim botlarıyla arama botlarını aynı torbaya koyar. OAI-SearchBot, Claude-SearchBot ve benzeri arama tarafı botların engellenmesi, sitenin yapay zeka arama cevaplarındaki kaynak havuzundan çıkması demektir. Bunun karşılığında kazanılan şey sınırlıdır, çünkü robots.txt'ye zaten uymayan kazıyıcılar bu satırlardan etkilenmez. Uyum sağlayan operatörün görünürlük kanalı kapanır, uyum sağlamayan kazıyıcı içeriği çekmeye devam eder.
Sunucudaki dosya ile yayınlanan dosyayı aynı sanmak
Cloudflare'in yönetilen robots.txt özelliği, sitenin mevcut robots.txt dosyasını silmez. Kendi yönettiği bloğu mevcut içeriğin önüne ekler ve ikisini tek yanıt olarak birleştirir. Sonuçta dosyada iki ayrı User-agent: * grubu oluşabilir ve sunucudaki dosya ile ziyaretçiye servis edilen dosya artık aynı değildir. Denetim her zaman yayınlanan sürüm üzerinden yapılmalıdır. Sitenizin yayınlanan robots.txt dosyasında hangi yapay zeka botlarının açık, hangilerinin kapalı olduğunu ücretsiz AI tarama denetimi aracıyla kontrol edebilirsiniz.
Hangi sinyali kim seçer?
Karar iki soruya indirgenebilir. Birincisi, içeriğin bir modele eğitim verisi olması size ne kazandırıyor. İkincisi, içeriğin yapay zeka cevaplarında kaynak olarak kullanılması size ne kazandırıyor.
ai-train=no demenin görünürlük maliyeti düşüktür. Eğitim taraması içeriği modelin ağırlıklarına gömer, karşılığında ne tıklama ne de atıf üretir. Bu yüzden Cloudflare'in varsayılanı da bu yönde. Özgün araştırma, veri seti, kurs içeriği veya arşiv üreten yayıncılar için bu tercih genelde nettir.
ai-input tarafı ise gerçek bir ödünleşme içerir. Kapatmak, içeriğin canlı cevaplarda kullanılmasını istememek demektir. Ama yapay zeka cevaplarında kaynak gösterilmek bugün birçok site için yeni bir trafik ve marka görünürlüğü kanalı. Ürün ve hizmet sayfalarını, dokümantasyonu veya destek içeriğini yapay zeka cevaplarında görmek isteyen bir işletme için ai-input'u kapatmak kendi ayağına sıkmak olur. Ücretli arşivi, lisanslı veriyi veya abonelikle satılan içeriği olan yayıncılar içinse tam tersi geçerli olabilir.
Tek bir doğru kombinasyon yok. Ama sinyalin ne yaptığı konusunda gerçekçi olmak gerekiyor: no yazmak içeriği korumaz, yalnız tercihi kayda geçirir. Koruma isteniyorsa iş uygulama katmanına düşer.
Sıkça Sorulan Sorular
Content Signals eklemek Google sıralamamı etkiler mi?
Doğrudan bir etkisi yok. Google'ın robots.txt ayrıştırıcısı content-signal satırını tanınan fakat kullanılmayan etiketler arasında sayıyor ve işlemiyor. Sıralamayı etkileyen şey satırın kendisi değil, aynı dosyaya birlikte eklenen Allow ve Disallow kurallarıdır.
Google-Extended'i engellersem aramadan düşer miyim?
Hayır. Google, Google-Extended'in bir sitenin Google Arama'ya dahil olmasını etkilemediğini ve arama içinde sıralama sinyali olarak kullanılmadığını belirtiyor. Bu belirteç Gemini modellerinin eğitimi ve Gemini uygulamalarındaki temellendirme içindir. Aramadan düşmeye yol açan şey Googlebot'un engellenmesidir.
Cloudflare kullanmıyorsam sinyalleri ekleyebilir miyim?
Evet. Politika CC0 lisansıyla yayımlandı, yani metin herhangi bir sitede serbestçe kullanılabilir. Yorum bloğunu ve Content-Signal satırını kendi robots.txt dosyanıza elle eklemek yeterli. Cloudflare'in yönetilen özelliği yalnız bu işi otomatikleştirir, sinyalin geçerliliği için şart değildir.
Content Signals ile llms.txt aynı şey mi?
Aynı şey değil. Content Signals mevcut robots.txt dosyasının içine yazılan ve kullanım tercihini bildiren bir satırdır. llms.txt ise ayrı bir dosyadır ve dil modellerine site içeriğinin düzenlenmiş bir özetini sunmayı hedefler. İkisi de bugün büyük arama motorları tarafından desteklenen resmi bir standart değil, dolayısıyla hiçbiri arama görünürlüğü için zorunlu bir koşul olarak sunulamaz.



