Crawler
Der Crawler geht die Seiten einer Website durch und nimmt die Dateien mit, die er darauf findet. Diese Seite beschreibt die Websites, die er beim Namen kennt, die Arten von Seiten, die er überall sonst liest, wohin er gehen darf und was er behält, wann er einen Browser verwendet, wie er mit einer Website umgeht und welche Seiten Sie sich vor einem Lauf ansehen.
Websites, die er beim Namen kennt
Für einige Websites hat der Crawler ein Rezept: eine Beschreibung, wo die Website ihre Dateien aufbewahrt und wie man durch sie blättert. Auf diesen Websites wählt der Assistent den Crawler aus, und nach der Art der Seite wird nicht gefragt.
| Website | Was der Crawler dort nimmt |
|---|---|
| 500px | einen Fotografen, einen Feed wie die beliebten Fotos, eine Galerie, eine Fotostory oder ein einzelnes Foto; die lange Kante bis 2048 Pixel |
| Bing Bilder | Ergebnisse der Bildersuche |
| Flickr | einen Fotostream, ein Album, Favoriten, einen Gruppenpool, ein Schlagwort, Explore, ein einzelnes Foto oder eine Suche; das Original nur dort, wo der Autor Downloads erlaubt, sonst die größte verfügbare Größe |
| Google Bilder | Ergebnisse der Bildersuche |
| IMDb | einen Film, eine Person oder eine Galerie |
| ein Subreddit oder einen Beitrag |
Bing Bilder und Google Bilder werden über einen Browser gelesen. Vor einem Lauf bei Google Bilder öffnet sich die Suche, damit Sie sie sich ansehen können - siehe Seiten, die Sie sich vor einem Lauf ansehen.
Für IMDb fragt der Assistent Bilder herunterladen und Videos herunterladen ab; IMDb gibt höchstens 100 Videos heraus. Außerdem zeigt er IMDb stellt Bedingungen für die Nutzung seiner Daten., und das Projekt lässt sich erst anlegen, wenn Sie Ich habe das gelesen anhaken.
Für Reddit zeigt der Assistent das bereits ausgefüllte Feld Reddit-Anwendungskennung. Reddit antwortet nur einer registrierten Anwendung; wenn Sie an seine Grenzen stoßen, registrieren Sie unter reddit.com/prefs/apps eine eigene als installed app und tragen Sie deren Kennung im Feld Reddit-Anwendungskennung ein.
Jede andere Seite
Auf einer Website, die er nicht beim Namen kennt, steht auf der Karte des Crawlers Funktioniert mit jeder Seite, kennt an dieser Website aber nichts Besonderes. Wählen Sie den Crawler, und der Assistent fragt Woher kommen die Dateien? Vorausgewählt ist nichts: Was das für eine Seite ist, wissen nur Sie.
| Auswahl | Was sie bedeutet |
|---|---|
| Nur diese Seite | Dateien, auf die die angegebene Adresse verweist, und nichts darüber hinaus |
| Galerie oder Album | Eine Seite mit einer Reihe von Bildern darauf |
| Forenthema | Ein Thema, mit Anhängen und Bildern in den Beiträgen |
| Die ganze Website oder ein Teil davon | Standardmäßig nur die angegebene Adresse und was darunter liegt |
Danach fragt der Abschnitt Dateitypen im Feld Herunterladen, was geladen werden soll: Bilder, standardmäßig angehakt, Video, Ton, Dokumente und Archive. Eine Datei, deren Art weder ihre Adresse noch die Antwort der Website verrät, wird trotzdem genommen.
Außer Wohin darf das gehen?, dazu unten mehr, fragt der Assistent nichts weiter; die übrigen Einstellungen jeder Auswahl stehen in den Website-Einstellungen des Projekts.
Wohin er gehen darf
Bei der Auswahl Die ganze Website oder ein Teil davon fragt der Assistent außerdem Wohin darf das gehen? Dort sind Bereiche vom engsten bis zum weitesten aufgeführt, und zur Arbeit gehört alles, was das Muster der gewählten Zeile abdeckt. Für https://example.com/gallery/7/ sind das die Zeilen example.com/gallery/7/*, example.com/gallery/*, example.com/* und *.example.com/* - die ganze Website samt ihren Subdomains.
Den Rest enthält der Abschnitt Adressen in den Website-Einstellungen des Projekts:
- Zusätzliche Adressen - ein Adressmuster pro Zeile, etwa
site.com/gallery/*. Links, die darauf passen, gehören ebenfalls zur Arbeit; die im Assistenten gewählte Zeile steht hier als erste. - Ausnahmen - Muster für Adressen, die der Durchlauf nicht aufsucht, wie auch immer er dorthin gelenkt wurde. Sie haben Vorrang vor den Adressen darüber.
- Schritte vom Start - wie weit sich der Durchlauf von der Adresse entfernen darf: ein Schritt je Link, dem er folgt, standardmäßig 3, höchstens 20. Eine weitere Seite derselben Auflistung kostet nichts, eine Datei ebenso wenig.
- Externe Links - Links, die aus der Arbeit hinausführen: Ignorieren, Nur Dateien von ihnen holen, was die Voreinstellung ist, oder Den Seiten folgen und die Dateien holen.
- Erlaubte externe Adressen - wohin der Durchlauf hinaustreten darf;
*, die Voreinstellung, bedeutet überallhin. - Welche Adressen als Dateien gelten - eine Regel pro Zeile, etwa
site.com/get-image/* = pictures, für ein Skript, das ein Bild ausliefert, oder einen Downloadlink ohne Endung. - Regeln für den Übergang - Ihre eigenen Bedingungen für einen Link, als Nicht hingehen, wenn oder Nur hingehen, wenn.
Die Ordnerstruktur der Website beibehalten unter Ordner legt alles so ab, wie es die Website tut - zuerst der Host, dann die Ordner aus der Adresse. Standardmäßig ist das ausgeschaltet, und alles landet zusammen.
Was er behält
Der Abschnitt Filter in den Website-Einstellungen des Projekts enthält:
- Mindestgröße und Höchstgröße, in Bytes; 0 bedeutet keine Grenze. Eine Datei, deren Größe die Website nicht genannt hat, wird genommen. Bei Forenthema steht die Mindestgröße zunächst auf 20480 Bytes: In einem Beitrag sind auch Avatare, Smileys und Rangabzeichen gewöhnliche Bilder.
- Mindestbreite und Mindesthöhe, in Pixeln. Die Größe eines Bildes steckt in der Datei, also wird das erst entschieden, nachdem sie heruntergeladen wurde: Ein Bild, das nicht passt, wird gelöscht, und das Journal meldet das.
- Regeln für die Auswahl - Ihre eigenen Bedingungen für eine Datei, als Nicht nehmen, wenn.
Bei Nur diese Seite gibt es unter Filter außerdem Welche Adressen als Dateien gelten: Von dieser Seite aus wird nichts verfolgt, eine Adresse, die ihre Art erst in der Antwort der Website verrät, wird also nie angefragt.
Bei Galerie oder Album gibt es unter Blättern die Einstellung Seiten einer Auflistung: wie viele Seiten derselben Auflistung durchlaufen werden. 0, die Voreinstellung, bedeutet alle - richtig für ein Album und falsch für einen endlosen Feed.
Wann er einen Browser verwendet
Manche Websites zeichnen ihre Seiten per Skript, und ohne Browser gibt es darauf nichts zu finden. Die Einstellung Browser verwenden unter Browser in den Website-Einstellungen des Projekts lässt die Wahl zwischen Automatisch entscheiden, Ja und Nein. Darf der Crawler selbst entscheiden, liest er die erste Seite jeder Website auf beide Arten und bleibt bei der, die mehr gefunden hat; im Journal steht, welche es war, samt beiden Zahlen. Ein Browser ist um ein Vielfaches langsamer.
Wenn eine Seite nichts hergibt, meldet das Journal Auf … wurde nichts gefunden - die Seite braucht vielleicht einen Browser.
Umgangsformen
Der Abschnitt Umgangsformen in den Plugin-Einstellungen des Projekts regelt, wie der Crawler mit einer Website umgeht:
- Sekunden zwischen Anfragen - die Pause zwischen zwei beliebigen Anfragen eines Laufs, gleich an welche Websites sie gehen, standardmäßig 1, höchstens 60. Je kürzer sie ist, desto wahrscheinlicher ist es, dass die Website anfängt, Anfragen abzulehnen, oder Ihnen die Tür weist; 0 ist der schnellste Weg zu einer gesperrten IP-Adresse. Siehe Das Tempo eines Laufs.
- Seiten aufbewahren - speichert jede gelesene Seite, damit der Rezept-Editor einen Lauf über diese Seiten wiederholen kann, ohne die Website erneut zu behelligen. Standardmäßig eingeschaltet.
- Rezepte verwenden - auf einer Website, die der Crawler beim Namen kennt, folgt er dem Rezept dieser Website. Schalten Sie das aus, um die Website auf gewöhnlichem Weg zu durchlaufen. Standardmäßig eingeschaltet.
- Bildhoster erkennen - liest einen Link auf einen Bildhoster als Bild mit einem Umstieg davor. Das Ausschalten lohnt sich, wenn ein Hoster seine Seiten geändert hat und statt eines Bildes Werbung ankommt. Standardmäßig eingeschaltet.
Der Crawler holt zwei Dateien gleichzeitig, alle Websites zusammengezählt. Bittet ihn eine Website, das Tempo zu drosseln, tut er das, und das Journal meldet … hat um Langsamkeit gebeten, wir lassen nach. Sekunden: ….
Seiten, die Sie sich vor einem Lauf ansehen
Manche Websites verlangen, dass Sie zuerst etwas von Hand tun: sich anmelden, eine Prüfung bestehen oder eine Suche eingrenzen. Seite vor einem Lauf anzeigen, ebenfalls unter Umgangsformen, entscheidet, wann sich die Startseite öffnet:
- Nie - der Lauf beginnt sofort.
- Wenn die Website es braucht - die Voreinstellung. Die Seite öffnet sich bei einer Website, deren Rezept angibt, dass sie Sie braucht, etwa bei Google Bilder.
- Immer - die Seite öffnet sich für jede Adresse des Projekts, bei einem Muster einmal, an seiner ersten Adresse.
Die Seite öffnet sich im Fenster Prüfen Sie das, bevor der Download beginnt und wartet. Tun Sie, was die Website braucht, und klicken Sie dann auf Weiter: Der Lauf beginnt dort, wo Sie gelandet sind, sodass bei einer Suche sowohl die Anfrage als auch die von Ihnen gesetzten Filter erhalten bleiben. Abbrechen hält den Lauf an, noch bevor er beginnt.
Wenn Sie im letzten Schritt des Assistenten Auf dieser Website muss ich mich zuerst anmelden anhaken, wird Immer eingestellt.
Parser reparieren
Auf dem Reiter Eigenschaften eines Projekts im NeoDownloader-Fenster bietet eine Karte Parser reparieren an: Damit öffnet sich der Rezept-Editor beim letzten Lauf des Projekts, an dem Schritt, der nichts mehr gefunden hat. Der Editor ist experimentell. Bevor er sich öffnet, zeigt NeoDownloader die Warnung Der Rezept-Editor ist noch nicht fertig, und womöglich gelingt es dem Editor nicht, den Lauf zu reparieren.