Tematy pomocy
Wszystkie tematy pomocy

Crawler

Crawler przechodzi po stronach serwisu i bierze pliki, które na nich znajduje. Ta strona omawia serwisy, które Crawler zna, rodzaje stron, które czyta wszędzie indziej, dokąd wolno mu iść i co zachowuje, kiedy używa przeglądarki, jak traktuje serwis oraz strony, które oglądasz przed przebiegiem.

Serwisy, które zna

Dla kilku serwisów Crawler ma przepis: opis tego, gdzie serwis trzyma swoje pliki i jak przechodzić przez kolejne strony z nimi. W tych serwisach kreator wybiera Crawlera i o rodzaj strony nie pyta.

Serwis Co Crawler tam bierze
500px fotografa, kanał taki jak popularne zdjęcia, galerię, historię w zdjęciach albo jedno zdjęcie; dłuższy bok do 2048 pikseli
Obrazy Bing wyniki wyszukiwania obrazów
Flickr strumień zdjęć, album, ulubione, pulę grupy, tag, Explore, jedno zdjęcie albo wyszukiwanie; oryginał tylko tam, gdzie autor pozwala na pobieranie, w przeciwnym razie największy dostępny rozmiar
Grafika Google wyniki wyszukiwania obrazów
IMDb film, osobę albo galerię
Reddit subreddit albo post

Obrazy Bing i Grafika Google są czytane przez przeglądarkę. Przed przebiegiem w serwisie Grafika Google wyszukiwanie otwiera się do obejrzenia - zobacz Strony, które oglądasz przed przebiegiem.

Dla IMDb kreator ma pola Pobieraj obrazy i Pobieraj filmy; IMDb udostępnia najwyżej 100 filmów. Kreator pokazuje też IMDb stawia warunki korzystania ze swoich danych., a projekt da się utworzyć dopiero po zaznaczeniu Przeczytane.

Dla Reddita kreator pokazuje pole Identyfikator aplikacji Reddit, już wypełnione. Reddit odpowiada tylko zarejestrowanej aplikacji; jeśli trafisz na jego limity, zarejestruj własną pod adresem reddit.com/prefs/apps jako aplikację typu installed app i wpisz jej identyfikator w polu Identyfikator aplikacji Reddit.

Każda inna strona

W serwisie, którego nie zna, kafelek Crawlera pokazuje Działa na dowolnej stronie, ale nie wie o tym serwisie nic szczególnego. Wybierz Crawlera, a kreator zapyta Skąd biorą się pliki? Nic nie jest zaznaczone z góry: tylko ty wiesz, czym jest ta strona.

Wybór Co oznacza
Tylko ta strona Pliki, do których prowadzą odnośniki z podanego adresu, i nic dalej
Galeria albo album Strona ze zbiorem obrazów
Wątek na forum Jeden temat, z załącznikami i obrazami w postach
Cały serwis albo jego część Domyślnie tylko podany adres i to, co leży pod nim

Potem na kroku Rodzaje plików kreator pyta w polu Pobieraj, co pobierać: Obrazy, domyślnie zaznaczone, Wideo, Dźwięk, Dokumenty i Archiwa. Plik, którego rodzaju nie zdradza ani jego adres, ani odpowiedź serwisu, i tak zostaje pobrany.

Poza pytaniem Dokąd wolno iść?, opisanym niżej, kreator o nic więcej nie pyta; pozostałe ustawienia każdego wyboru są w grupie Ustawienia serwisu projektu.

Dokąd wolno mu iść

Dla wyboru Cały serwis albo jego część kreator pyta jeszcze Dokąd wolno iść? Wymienia obszary od najwęższego do najszerszego, a zadanie obejmuje wszystko, co pokrywa wzorzec w wybranym wierszu. Dla https://example.com/gallery/7/ wiersze to example.com/gallery/7/*, example.com/gallery/*, example.com/* i *.example.com/* - cały serwis z subdomenami.

Resztę zawiera sekcja Adresy w grupie Ustawienia serwisu projektu:

  • Dodatkowe adresy - jeden wzorzec adresu w wierszu, na przykład site.com/gallery/*. Pasujące do nich odnośniki też należą do zadania; wiersz wybrany w kreatorze jest tu zapisany jako pierwszy.
  • Wyjątki - wzorce adresów, na które obchód nie wchodzi, bez względu na to, co go na nie skierowało. Mają pierwszeństwo przed adresami powyżej.
  • Kroki od startu - jak daleko obchód może odejść od adresu: jeden krok za każdy odnośnik, za którym idzie, domyślnie 3, najwyżej 20. Kolejna strona tej samej listy nic nie kosztuje, plik też nie.
  • Odnośniki zewnętrzne - odnośniki, które prowadzą poza zadanie: Ignoruj je, Bierz z nich tylko pliki, co jest ustawieniem domyślnym, albo Wchodź na strony i bierz pliki.
  • Dozwolone adresy zewnętrzne - dokąd obchód może wyjść; *, wartość domyślna, oznacza dowolne miejsce.
  • Które adresy są plikami - jedna reguła w wierszu, na przykład site.com/get-image/* = pictures, dla skryptu, który podaje obraz, albo dla odnośnika do pobrania bez rozszerzenia.
  • Reguły przechodzenia po odnośnikach - własne warunki dla odnośnika, w postaci Nie idź tam, gdy albo Idź tam tylko wtedy, gdy.

Zachowuj własne foldery serwisu, w sekcji Foldery, układa wszystko tak, jak robi to serwis - najpierw host, potem foldery z adresu. Domyślnie jest wyłączone i wszystko trafia do jednego miejsca.

Co zachowuje

Sekcja Filtry w grupie Ustawienia serwisu projektu:

  • Minimalny rozmiar i Maksymalny rozmiar, w bajtach; 0 oznacza brak limitu. Plik, którego rozmiaru serwis nie podał, zostaje pobrany. Dla wyboru Wątek na forum minimalny rozmiar jest z góry ustawiony na 20480 bajtów: w poście awatary, emotikony i odznaki rang to także zwykłe obrazy.
  • Minimalna szerokość i Minimalna wysokość, w pikselach. Wymiary obrazu są zapisane w pliku, więc decyzja zapada dopiero po jego pobraniu: obraz, który nie pasuje, zostaje usunięty, a dziennik o tym informuje.
  • Reguły zachowywania - własne warunki dla pliku, w postaci Nie bierz, gdy.

Dla wyboru Tylko ta strona sekcja Filtry ma też pole Które adresy są plikami: z tej strony obchód nigdzie dalej nie idzie, więc adres, który zdradza swój rodzaj dopiero w odpowiedzi serwisu, nigdy nie zostaje odpytany.

Dla wyboru Galeria albo album sekcja Stronicowanie ma pole Strony jednej listy: ile stron tej samej listy przejść. 0, wartość domyślna, oznacza wszystkie - właściwe dla albumu, a niewłaściwe dla niekończącego się kanału.

Kiedy używa przeglądarki

Niektóre serwisy rysują swoje strony skryptem i bez przeglądarki nie ma na nich nic do znalezienia. Używaj przeglądarki, w sekcji Przeglądarka w grupie Ustawienia serwisu projektu, ma wartości Zdecyduj automatycznie, Tak albo Nie. Gdy decyzja należy do Crawlera, czyta on pierwszą stronę każdego serwisu na oba sposoby i zostaje przy tym, który znalazł więcej; dziennik podaje, przy którym, razem z obiema liczbami. Przeglądarka jest kilkadziesiąt razy wolniejsza.

Gdy strona nic nie daje, w dzienniku pojawia się Nic nie znaleziono pod … - strona może potrzebować przeglądarki.

Dobre maniery

Dobre maniery, w grupie Ustawienia wtyczki projektu, to sposób, w jaki Crawler traktuje serwis:

  • Sekundy między żądaniami - przerwa między dowolnymi dwoma żądaniami przebiegu, bez względu na to, do jakich serwisów idą; domyślnie 1, najwyżej 60. Im krótsza, tym bardziej prawdopodobne, że serwis zacznie odmawiać albo zamknie przed tobą drzwi; 0 to najszybszy sposób, żeby twój adres IP został zablokowany. Zobacz Tempo przebiegu.
  • Zachowuj strony - zapisuje każdą przeczytaną stronę, żeby edytor przepisów mógł powtórzyć na nich przebieg bez ponownego sięgania do serwisu. Domyślnie włączone.
  • Używaj przepisów - w serwisie, który Crawler zna, postępuje według przepisu tego serwisu. Wyłącz, żeby przejść serwis zwykłym sposobem. Domyślnie włączone.
  • Rozpoznawaj hostingi obrazów - traktuje odnośnik do hostingu obrazów jak obraz, do którego trzeba wykonać jeszcze jeden przeskok. Warto wyłączyć, jeśli hosting zmienił swoje strony i zamiast obrazu przychodzi reklama. Domyślnie włączone.

Crawler pobiera dwa pliki naraz, licząc wszystkie serwisy razem. Gdy serwis prosi o wolniejsze tempo, Crawler zwalnia, a w dzienniku pojawia się … poprosił o wolniejsze tempo, zwalniam. Sekund: ….

Strony, które oglądasz przed przebiegiem

Niektóre serwisy wymagają najpierw ręcznego działania: zalogowania się, przejścia weryfikacji albo zawężenia wyszukiwania. Pokaż stronę przed przebiegiem, także w sekcji Dobre maniery, decyduje, kiedy otwiera się strona startowa:

  • Nigdy - przebieg zaczyna się od razu.
  • Gdy serwis tego wymaga - wartość domyślna. Strona otwiera się w serwisie takim jak Grafika Google, którego przepis mówi, że potrzebny jest twój udział.
  • Zawsze - strona otwiera się dla każdego adresu projektu, a dla wzorca raz, przy jego pierwszym adresie.

Strona otwiera się w oknie Sprawdź to, zanim pobieranie się zacznie i czeka. Zrób to, czego wymaga serwis, a potem kliknij Dalej: przebieg zaczyna się od miejsca, w którym wtedy jesteś, więc w wyszukiwaniu zachowuje i zapytanie, i ustawione filtry. Anuluj zatrzymuje przebieg, zanim się zacznie.

Zaznaczenie W tym serwisie muszę się najpierw zalogować na ostatnim kroku kreatora ustawia Zawsze.

Napraw analizator

Na karcie Właściwości projektu, w oknie NeoDownloadera, kafelek proponuje Napraw analizator: otwiera edytor przepisów z ostatnim przebiegiem projektu, na kroku, na którym przestało się cokolwiek znajdować. Edytor jest eksperymentalny. Zanim się otworzy, NeoDownloader ostrzega Edytor przepisów nie jest ukończony i uprzedza, że edytor może nie dać rady naprawić przebiegu.