seoraporu.co

Indeksowalność: plik robots.txt i metatagi robots

Czym są plik robots.txt i meta tag robots?

robots.txt to plik tekstowy znajdujący się w katalogu głównym witryny (np. https://ornek.com/robots.txt) i informujący roboty wyszukiwarek, które katalogi lub strony mogą indeksować (crawl). Tag meta robots natomiast znajduje się w sekcji HTML <head> i decyduje o tym, czy strona, nawet jeśli została zindeksowana, zostanie uwzględniona w wynikach wyszukiwania (index). Oba elementy działają na różnych poziomach: jeden odpowiada na pytanie „czy możesz wejść przez te drzwi”, a drugi – „czy po wejściu możesz dodać ten pokój do katalogu”.

To rozróżnienie jest często mylone, ponieważ o obu mówi się w kontekście „zarządzania botami”, ale ich obszary działania są zupełnie różne, a niewłaściwe połączenie może prowadzić do niepożądanych skutków.

Plik robots.txt jest w rzeczywistości „żądaniem przestrzegania zasad”, a nie środkiem bezpieczeństwa: boty działające w dobrej wierze (takie jak Googlebot) przestrzegają tych zasad, jednak boty działające w złej wierze mogą całkowicie zignorować ten plik. Dlatego próba „ukrycia” poufnych lub wrażliwych treści za pomocą pliku robots.txt jest błędnym założeniem dotyczącym bezpieczeństwa.

Dlaczego to ma znaczenie?

Pomieszanie tych dwóch mechanizmów może poważnie zaszkodzić widoczności witryny. Jeśli strona zostanie zablokowana przed indeksowaniem za pomocą pliku robots.txt, wyszukiwarka może w ogóle nie dostrzec tagu noindex — ponieważ aby go zobaczyć, musi najpierw przeszukać stronę — a strona może przypadkowo pozostać w indeksie (zazwyczaj jako wpis bez tytułu i opisu).

Natomiast przy prawidłowym zastosowaniu te dwa narzędzia pozwalają precyzyjnie zarządzać tym, które treści pojawią się w wynikach wyszukiwania: plik robots.txt pozwala wykluczyć z budżetu indeksowania nieistotne obszary (np. panel administracyjny, strony wyników wyszukiwania), natomiast meta tag robots zapewnia usunięcie określonych stron (np. strony z podziękowaniami, zfiltrowane warianty list) z indeksu.

W przypadku dużych witryn budżet indeksowania jest zasobem ograniczonym: bot podczas każdej wizyty indeksuje tylko część witryny. Zablokowanie za pomocą pliku robots.txt obszarów o niewielkiej wartości (np. stron wyników wyszukiwania wewnętrznego, kombinacji filtrów) pozwala botowi poświęcić czas na naprawdę ważne strony.

Jak to naprawić?

Przykład

User-agent: *
Disallow: /admin/
Allow: /

<meta name="robots" content="noindex, follow">

Zły przykład: najpierw zablokowanie strony Disallow: /kampanya/ w pliku robots.txt, a następnie dodajesz ją do samej strony <meta name="robots" content="noindex"> — ponieważ bot nigdy nie zindeksuje tej strony, atrybut noindex nie zadziała, a strona nadal może pojawiać się w indeksie.

Często popełniane błędy