robots.txt Üretici
Tek yanlış satır sitenizi aramadan tamamen silebilir. Bu araç kuralları yazarken ne yaptığınızı da söylüyor.
Adresi yazıp düğmeye basın: haritanız gerçekten neredeyse o adres yazılır.
Her satıra bir yol. Sepet, hesap, arama sonucu ve filtre adresleri tipik örnekler.
Yapay zekâ tarayıcıları
İkisi aynı şey değil: eğitim botları içeriğinizi model eğitmek için topluyor, yanıt botları kullanıcı soru sorduğunda sayfanızı okuyup sizi kaynak gösteriyor.
GPTBotOpenAI, model eğitimiClaudeBotAnthropic, model eğitimiGoogle-ExtendedGoogle Gemini eğitimi (aramayı etkilemez)CCBotCommon Crawl, açık veri kümesiApplebot-ExtendedApple, model eğitimimeta-externalagentMeta, model eğitimiBytespiderByteDance, model eğitimi
OAI-SearchBotChatGPT arama sonuçlarıChatGPT-UserChatGPT, kullanıcı bağlantı açtığındaPerplexityBotPerplexity aramaClaude-UserClaude, kullanıcı bağlantı açtığında
Kuralları seçinsiteniz.com/robots.txtGiriş
SEO'da geri dönüşü en hızlı, hasarı en büyük hata iki satırdır: User-agent: * ve altına Disallow: /. Bu ikisi "hiçbir sayfamı tarama" demek.
Genelde geliştirme aşamasında bilinçli konuyor ve yayına alırken kaldırılması unutuluyor. Siteniz haftalarca aramada görünmüyor, kimse sebebini anlamıyor. Yeni açılan sitelerde en yaygın sorun bu.
Bu sayfa dosyanın ne yaptığını, neyi yapmadığını, neyi engellememeniz gerektiğini ve yapay zekâ botlarında hangi ayrımın işletmenizi doğrudan ilgilendirdiğini anlatıyor.
robots.txt nedir?
Sitenizin kök dizininde duran, arama motoru tarayıcılarına hangi yolları tarayabileceklerini söyleyen düz metin dosyasına robots.txt deniyor. Adresi her zaman siteniz.com/robots.txt; başka bir yere konduğunda okunmuyor.
Dosya Robots Exclusion Protocol adlı bir standarda dayanıyor ve 2022'de RFC 9309 ile resmî bir belge hâline geldi. Yani gayriresmî bir uzlaşı değil, tanımlı kuralları olan bir protokol.
En önemli ayrım şu: robots.txt taramayı engelliyor, dizine eklemeyi değil. Engellenen bir sayfa dışarıdan bağlantı almışsa Google adresini yine de dizinde tutabiliyor; içeriğini okuyamadığı için başlık ve açıklama olmadan, çıplak bir bağlantı olarak.
robots.txt ne yapar, ne yapmaz?
Yapar: tarayıcılara hangi adresleri istemediğinizi söyler. Uyan botlar uyar.
Yapmaz: erişimi engellemez. Dosya herkese açıktır ve bir ricadır; kötü niyetli bir tarayıcı umursamaz. Gizli kalması gereken bir adresi buraya yazmak, onu ilan etmekten başka bir şey değildir; dosyayı açan herkes o adresi görür.
Ve en kritik ayrım: robots.txt sayfayı *dizinden* çıkarmaz. Engellenen bir sayfaya başka sitelerden bağlantı varsa Google onu içeriğini okumadan dizine ekleyebiliyor; sonuçta başlıksız, açıklamasız bir kayıt beliriyor.
Bir sayfanın aramada görünmemesini istiyorsanız doğru yol o sayfaya noindex etiketi koymak. Ve o sayfayı robots.txt ile engellememek: engellerseniz Google sayfayı açamıyor, etiketi okuyamıyor ve talebinizi göremiyor.
Araştırma ne diyor
robots.txt dosyası, bir sayfanın Google'da görünmesini engellemek için bir yöntem değildir. Sayfaya başka sitelerden bağlantı verilmişse, Google sayfayı ziyaret etmeden de dizine ekleyebilir.
Bir sayfayı aramadan tamamen çıkarmak için `noindex` yönergesini kullanın ya da sayfayı parola ile koruyun.
`noindex` yönergesinin işe yaraması için sayfanın taranabilir olması gerekir. Sayfa robots.txt ile engellenirse tarayıcı yönergeyi hiç göremez ve sayfa dizinde kalmaya devam edebilir.
Google Search Central: robots.txt dosyasına girişResmî kaynak
Neyi engellemeli, neyi asla?
Engellenmesi mantıklı olanlar: sepet, ödeme ve hesap gibi kişiye özel sayfalar; site içi arama sonuç sayfaları; sonsuz filtre birleşimleri üreten adresler; yönetim panelleri ve teknik dizinler.
CSS ve JavaScript dosyalarını asla engellemeyin. Google sayfayı gerçek bir tarayıcı gibi çiziyor. Stil ve betikleri engellerseniz sayfayı bozuk görüyor, mobil uyumluluk değerlendirmesinde kaybediyorsunuz. Bu hata hâlâ çok yaygın ve araç bunu ayrıca uyarıyor.
Görsel klasörlerini engellemeyin: görsel aramasından gelen ziyaretçiyi tamamen kesiyor.
Site haritanızı engellemeyin ve Sitemap: satırını mutlaka ekleyin. Dosyanın en faydalı satırı o.
Yapay zekâ tarayıcıları: iki ayrı karar
2024'ten sonra en çok sorulan konu bu ve çoğu yerde yanlış anlatılıyor. Yapay zekâ botları tek bir grup değil; aradaki fark işletmeniz için çok şey değiştiriyor.
Eğitim botları (GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended) içeriğinizi model eğitmek için topluyor. Bunları engellemek arama görünürlüğünüzü etkilemiyor. İçeriğinizin eğitimde kullanılmasını istemiyorsanız engellemek tutarlı bir tercih.
Burada sık karıştırılan bir ayrıntı var: Google-Extended yalnız Gemini eğitimiyle ilgili, Google aramasındaki sıralamanızı etkilemiyor. Googlebot ile ikisi ayrı botlar ve ayrı ayrı yönetiliyor.
Yanıt botları (OAI-SearchBot, ChatGPT-User, PerplexityBot, Claude-User) kullanıcı bir soru sorduğunda sayfanızı okuyup sizi kaynak gösteriyor. Engellerseniz o yanıtlarda görünmezsiniz.
Yani "yapay zekâyı engelle" diye tek bir düğme yok. Çoğu KOBİ için doğru kurulum eğitimi kısıtlayıp yanıt botlarını serbest bırakmak ya da ikisini de serbest bırakmak oluyor. Bu sitenin kendi tercihi ve gerekçesi yapay zekâ ve içerik kullanımı sayfamızda açık açık yazılı.
Sık yapılan diğer hatalar
Yanlış yere koymak. Dosya kök dizinde olmalı: siteniz.com/robots.txt. Alt klasördeki dosya okunmuyor. Alt alan adları da kendi dosyasını ister; blog.siteniz.com için ayrı bir robots.txt gerekiyor.
Karakter kümesi belirtmemek. Dosya UTF-8 olmalı ve sunucu bunu bildirmeli. Aksi hâlde Türkçe karakterler bozuk görünüyor. Bu sitede robots.txt bir Worker rotasından servis ediliyor, tam da bu yüzden.
Crawl-delay yazmak. Google bu satırı yok sayıyor. Tarama hızıyla ilgili bir sorununuz varsa yeri Search Console.
noindex satırı yazmak. robots.txt'te böyle bir yönerge yok; Google 2019'da desteği tamamen kaldırdı. O etiket sayfanın kendisine konur.
Tarama bütçesi sizin sorununuz mu?
Büyük ihtimalle değil ve bunu söyleyen az kaynak var. Tarama bütçesi, Google'ın bir siteye ayırdığı tarama kapasitesine verilen ad; İngilizcesi crawl budget.
Google bu konuda net: tarama bütçesi, milyonlarca adresi olan sitelerin meselesi. Beş bin sayfanın altındaki bir site için Google'ın kapasitesi fazlasıyla yeterli ve robots.txt ile bütçe yönetmeye çalışmak çözdüğünden çok sorun çıkarıyor.
Bir KOBİ sitesinde robots.txt'in işi bütçe yönetmek değil, yanlış yerlerin taranmasını önlemek: yönetim paneli, deneme ortamı, site içi arama sonuçları ve parametreyle üreyen adresler.
Gerçekten büyük bir kataloğunuz varsa durum değişiyor. Filtreleme adresleri (renk, beden, fiyat aralığı) ve takvim gibi sonsuz adres üreten bölümler ciddi bir yük oluşturabiliyor; orada robots.txt keskin bir araç hâline geliyor.
CSS ve JavaScript dosyalarını asla engellemeyin
Sık yapılan ve etkisi geç fark edilen bir hata. Bir dönem "gereksiz dosyalar taranmasın" mantığıyla /wp-includes/ ya da /assets/ gibi yolları kapatmak yaygındı; bugün bu doğrudan zarar veriyor.
Sebebi şu: Googlebot sayfayı bir tarayıcı gibi çiziyor. Stil ve betik dosyalarına erişemezse sayfayı bozuk görüyor. Mobil uyumluluğu, düzeni ve içeriğin görünürlüğünü o bozuk hâle bakarak değerlendiriyor.
Pratik kural: görüntülemeye katkısı olan hiçbir dosya engellenmemeli. Kapatılacak yerler sayfanın çizilmesiyle ilgisi olmayan bölümler; stil dosyası, betik ve görsel bunların dışında.
Sık sorulanlar
robots.txt küçük bir dosya ama yanlış yazıldığında sitenin tamamını aramadan düşürebilecek kadar etkili; bu yüzden sorular hem ne yapabildiği hem de ne yapamadığı üzerine yoğunlaşıyor. Aşağıdaki dört soru en sık karıştırılan noktalar; cevaplarda dosyanın sınırını da açıkça yazdık.
robots.txt olmazsa ne olur?
Hiçbir şey olmaz. Dosya yoksa tarayıcılar "her şey taranabilir" varsayıyor ve normal biçimde çalışıyor; sitenizde kapatmanız gereken bir bölüm yoksa bu zaten istediğiniz sonuç.
Küçük bir site için dosyanın olmaması, yanlış yazılmış olmasından iyi. Tek satırlık bir hata, örneğin yayına alınırken silinmesi unutulan bir Disallow: /, bütün siteyi taramaya kapatıyor ve bunu kimse size haber vermiyor.
Dosyayı koymanın en somut faydası site haritası satırı: Sitemap: ile haritanızın adresini bildirdiğinizde tarayıcılar sayfa listenize doğrudan ulaşıyor.
Değişikliği Google ne zaman görür?
Genelde bir gün içinde. Google robots.txt'i sık kontrol ediyor ve önbelleğini yaklaşık yirmi dört saatte bir yeniliyor.
Ne gördüğünü Search Console'daki robots.txt raporundan doğrulayabilirsiniz: dosyanın Google'ın elindeki son sürümünü, son tarama zamanını ve varsa söz dizimi hatalarını gösteriyor.
Acil bir durumda, örneğin yanlışlıkla siteyi kapattıysanız, düzeltmeyi yapıp aynı rapordan yeniden tarama isteyebilirsiniz. Bu sürede sayfaların dizinden düşmesi genelde başlamamış oluyor.
Bir botu engelledim ama hâlâ geliyor, neden?
Çünkü robots.txt bir kilit değil, bir rica. Dosyayı okumayı ve uymayı tarayıcının kendisi seçiyor; büyük arama motorları uyuyor, kötü niyetli tarayıcılar umursamıyor.
Gerçekten durdurmak istiyorsanız iş sunucu tarafına geçiyor: kullanıcı aracısına ya da IP aralığına göre engelleme, hız sınırı, ya da bir güvenlik katmanı. Cloudflare gibi bir servis kullanıyorsanız bunu panelden yapabiliyorsunuz.
Bir de şu var: robots.txt taramayı engelliyor, dizine girmeyi değil. Bir sayfaya başka sitelerden bağlantı veriliyorsa Google onu tarayamadığı halde adres olarak sonuçlarda gösterebiliyor. Sayfanın aramada hiç görünmemesi gerekiyorsa doğru araç noindex etiketi; robots.txt ile kapatılmış bir sayfada Google o etiketi zaten okuyamıyor.
Girdiğim bilgiler bir yere gidiyor mu?
Hayır. Dosya tarayıcınızda üretiliyor; adresiniz ve kurallarınız bize ulaşmıyor.
Ürettiğiniz dosya sitenizin kök dizinine robots.txt adıyla, yani example.com/robots.txt adresinden açılacak şekilde konuyor. Alt klasöre konan bir robots.txt hiçbir işe yaramıyor; tarayıcılar yalnız kök dizindekini okuyor.
Aracı beğendiniz mi?
Bu aracı ve altındaki açıklamayı, işini kendi yürüten bir işletme sahibine yetecek açıklıkta yazmaya çalıştık.
Teşekkür ederiz. Bundan sonraki çalışmaları da aynı açıklıkta yazmayı sürdüreceğiz.
Teşekkür ederiz. Eksik bulduğunuz noktayı info (at) kobiseo (nokta) com adresine iletirseniz sayfayı gözden geçirir ve düzeltmeyi geçmişe işleriz.
Bu araç nasıl hazırlandı. Üreticilerin çoğu ne seçerseniz onu yazıyor. Bu araç seçtiğiniz kuralın karşılığını da söylüyor: yayındaki bir sitede tamamen engelleme, CSS/JS engeli ve robots.txt'e yazılmış noindex için ayrı ayrı uyarı üretiyor.
Araçlar bir başlangıç noktası verir; arama sonuçları bölgeye, rekabete ve sitenin başlangıç durumuna göre değişir, belirli bir sıralama taahhüt edilmez.
Bir yanlış gördüyseniz info (at) kobiseo (nokta) com adresine yazın. Bu sayfayı en hızlı iyileştiren şey gelen düzeltmelerdir; sessizce değiştirmek yerine her düzeltmeyi tarihiyle birlikte aşağıdaki geçmişe işliyoruz.
Bu sayfa alıntılanabilir. Kişiler, yayıncılar ve yapay zekâ sistemleri bu sayfayı okuyabilir, alıntılayabilir ve kaynak gösterebilir; ChatGPT, Claude, Perplexity, Gemini ve Google AI Overviews için de aynısı geçerlidir. Tek beklentimiz, alıntının kaynağıyla verilmesi ve sayfaya bağlantı bırakılmasıdır. Metnin biçimlendirmeden arınmış sürümü için adresin sonuna .md eklemeniz yeterli.
Hazırlayan
KOBİ SEO Teknik Ekibi
Araç Geliştirme, Test ve Doğrulama
Bu araçları teknik ekibimiz geliştirdi, kendi içinde test etti ve yayına almadan önce çıktısını bilinen bir karşılıkla karşılaştırarak doğruladı. Hesaplamanın tamamı tarayıcınızda çalışıyor; girdiğiniz hiçbir bilgi sunucuya gitmiyor.
Araçların hepsi güncel arama motoru belgelerine göre yazıldı ve o belgeler değiştiğinde birlikte güncelleniyor. Sayfanın altındaki kaynak listesi, buradaki her kuralın hangi resmî belgeye dayandığını gösteriyor; bir kural yürürlükten kalktığında araç da, metin de yenileniyor.
Kaynaklar ve güncelleme geçmişi
Kaynaklar
- Google Search Central: robots.txt dosyasına giriş, Google (developers.google.com)Resmî kaynak
- Google Search Central: Google tarayıcıları ve kullanıcı aracıları, Google (developers.google.com)Resmî kaynak