🤖 Robots.txt Nedir?
Robots.txt, web sitesine gelen arama motoru tarayıcılarına hangi URL'lere erişebileceklerini veya hangi bölümleri taramamaları gerektiğini bildiren düz metin dosyasıdır.
Dosya genellikle sitenin ana dizininde bulunur:
https://siteadresi.com/robots.txt
Google'a göre robots.txt esas olarak tarama trafiğini yönetmek için kullanılır. Bir sayfayı Google Arama'dan tamamen kaldırmak için robots.txt tek başına kullanılmamalıdır. citeturn0search0turn0search2
📌 Robots.txt Ne İşe Yarar?
Robots.txt ile arama motoru tarayıcılarına belirli URL yolları için tarama kuralları tanımlanabilir.
Örneğin;
🔹 Gereksiz URL'lerin taranmasını azaltmak
🔹 Benzer veya önemsiz bölümlerin taranmasını sınırlamak
🔹 Tarama trafiğini yönetmek
🔹 Sitemap adresini belirtmek
gibi amaçlarla kullanılabilir.
📝 Basit Robots.txt Örneği
Kod:
User-agent: *
Allow: /
Sitemap: https://www.siteadresi.com/sitemap.xml
Bu yapı, genel tarayıcılara siteyi tarayabileceklerini bildirirken sitemap adresini de belirtir. Google'ın robots.txt dokümantasyonunda da Sitemap satırının tam URL ile belirtilmesi önerilmektedir.
🚫 Disallow Nedir?
Disallow, belirli bir URL yolu için tarama erişimini sınırlamak amacıyla kullanılır.
Örneğin:
Kod:
User-agent: *
Disallow: /admin/
Burada tarayıcılara `/admin/` yolu altındaki URL'leri taramamaları söylenmektedir.
Ancak robots.txt ile engellenen bir URL'nin internette başka bağlantılar üzerinden keşfedilmesi ve URL'nin bazı durumlarda Google sonuçlarında görünmesi mümkün olabilir. citeturn0search0
⚠️ Robots.txt ile Noindex Aynı Şey Değildir
Bu webmasterların en sık karıştırdığı konulardan biridir.
Robots.txt → Tarama erişimini kontrol eder.
Noindex → Sayfanın Google arama sonuçlarında dizine alınmamasını belirtir.
Google, noindex yönergesinin görülebilmesi için Googlebot'un sayfayı tarayabilmesi gerektiğini açıkça belirtiyor. Bu nedenle aynı URL'yi robots.txt ile engelleyip Google'ın noindex etiketini okumasını beklemek doğru değildir.
🗺️ Robots.txt İçinde Sitemap
Sitemap adresi robots.txt içerisinde belirtilebilir:
Kod:
Sitemap: https://www.siteadresi.com/sitemap.xml
Sitemap satırının tam URL ile verilmesi gerekir.
🔍 Robots.txt Nerede Bulunmalı?
Robots.txt dosyası sitenin ilgili hostunun en üst düzey dizininde bulunmalıdır.
Örneğin:
https://www.siteadresi.com/robots.txt
Alt klasörde bulunan farklı bir robots.txt dosyası, sitenin tamamı için geçerli olmaz. Google'ın robots.txt kuralları host, protokol ve port kapsamında değerlendirilir. citeturn0search7
🛠️ Robots.txt Kontrol Listesi
☑ Dosya `/robots.txt` adresinden açılıyor mu?
☑ Önemli sayfalar yanlışlıkla Disallow edilmiş mi?
☑ CSS ve JavaScript gibi Google'ın sayfayı anlaması için ihtiyaç duyabileceği kaynaklar gereksiz yere engellenmiş mi?
☑ Sitemap adresi doğru mu?
☑ Kurallar yalnızca gerekli URL yollarını mı kapsıyor?
☑ Noindex ile robots.txt birbirine karıştırılmış mı?
☑ Değişiklik sonrasında önemli sayfaların erişimi kontrol edildi mi?
💡 Önemli Webmaster Notu
Robots.txt dosyasını gereksiz şekilde karmaşıklaştırmak yerine yalnızca gerçekten tarama yönetimi ihtiyacı bulunan URL'ler için kural oluşturmak daha sağlıklı bir yaklaşımdır.
Google'ın teknik koşullarına göre bir sayfanın dizine alınabilmesi için Googlebot'un engellenmemesi, sayfanın başarılı bir HTTP 200 durumuyla erişilebilir olması ve dizine eklenebilir içeriğe sahip olması gerekir. Ancak bu koşulların karşılanması indeksleme garantisi vermez. citeturn0search6
💬 Sizin Robots.txt Dosyanız Nasıl?
Web sitenizde robots.txt nedeniyle tarama veya indeksleme sorunu yaşadınız mı?
Kullandığınız yapı ve deneyimlerinizi ForumHayali'nde paylaşabilirsiniz. 👇
🌐 ForumHayali
Webmaster,
SEO, Google, WordPress ve web teknolojileri hakkında güncel bilgiler ForumHayali'nde.