Crawler (Web Crawler)
Crawler jest to program używany przez wyszukiwarki internetowe do skanowania stron. Crawler ma za zadanie odwiedzić stronę internetową, zebrać znajdujące się na niej informacje i wykorzystać je go zaktualizowania indeksu wyszukiwarki internetowej.
To zagadnienie wchodzi w zakres usługi audyt SEO, tam opisaliśmy, jak wykorzystujemy je w codziennej pracy. Stawki za tę usługę zebraliśmy w cenniku.
Zobacz również: Bot, Googlebot
Jak pracuje crawler?
Crawler porusza się po sieci, przechodząc z linku na link: pobiera stronę, wypisuje z niej odnośniki, dodaje je do kolejki i odwiedza kolejne adresy. Googlebot, najważniejszy z crawlerów, robi to w dwóch etapach: najpierw pobiera surowy HTML, a później renderuje stronę z JavaScriptem, by zobaczyć ją tak, jak widzi ją użytkownik. Częstotliwość odwiedzin zależy od autorytetu domeny i tempa zmian treści, co wiąże się bezpośrednio z pojęciem crawl budget.
Jak sterować robotem na swojej stronie?
Właściciel serwisu ma kilka narzędzi kontroli: plik robots.txt wskazuje, gdzie robot nie powinien wchodzić, mapa witryny XML podpowiada, co warto odwiedzić, a tagi noindex i canonical porządkują to, co trafia do indeksu. Sprawne linkowanie wewnętrzne i szybki serwer sprawiają, że crawler zdąży odwiedzić więcej podstron podczas jednej wizyty, a nowa oferta szybciej pojawi się w wynikach wyszukiwania.
Crawler decyduje, które strony trafią do wyników wyszukiwania. Ułatwiając mu pracę mapą witryny, linkowaniem i szybkim serwerem, skracasz drogę nowej oferty do klienta.