Wtyczka do Chrome
Przeglądarka mapy witryny
Zobacz cały serwis jako drzewo i wyślij gałąź do scrapera.
Wszystkie dziewięć narzędziPrzeglądarka czyta mapę witryny, wchodzi w pliki indeksowe i buduje drzewo serwisu po strukturze adresów, z licznikiem na każdej gałęzi. Tak dowiadujesz się, co tam w ogóle jest, zanim cokolwiek wyciągniesz.
Gdy serwis nie publikuje mapy, przechodzi grzecznie od strony głównej do zadanej głębokości. Tak czy inaczej kończysz z gałęzią, którą oddasz ekstraktorowi stron bez wklejania choćby jednego adresu.
Zrzut ekranu pojawi się razem z narzędziem. Nic tutaj nie jest rysunkiem, więc to miejsce zostaje puste do czasu prawdziwego zrzutu.
Jak to działa
- Krok 1
Podaj domenę
Tabitha szuka mapy witryny w robots.txt i pod typowymi adresami, a potem czyta znalezione pliki indeksowe.
- Krok 2
Przeczytaj drzewo
Każdy segment adresu staje się węzłem z licznikiem, więc od razu widzisz, że sklep ma 4 000 stron produktowych i 12 stron kategorii.
- Krok 3
Wybierz gałąź i przefiltruj
Zaznacz gałąź, dodaj wzorzec albo wyklucz jeden, i sprawdź datę ostatniej zmiany tam, gdzie mapa ją podaje.
- Krok 4
Przekaż dalej
Wypchnij zaznaczenie do ekstraktora stron jako listę adresów albo wyeksportuj jako CSV.
Kiedy po to sięgnąć
- Planowanie zadania: ile jest stron i jak są ułożone.
- Audyty treści i SEO, w których pytaniem jest struktura adresów.
- Budowa listy adresów bez przeklikiwania paginacji.
Czego nie zrobi
- Mapa witryny mówi to, co serwis zdecydował się opublikować. Strony poza nią się nie pojawią.
- Przejście serwisu bez mapy jest wolniejsze celowo, bo to więcej żądań.
- Bardzo duże mapy czytane są partiami, żeby przeglądarka pozostała responsywna.