Crawler
Le Crawler parcourt les pages d'un site et prend les fichiers qu'il y trouve. Cette page présente les sites qu'il connaît par leur nom, les types de page qu'il lit partout ailleurs, où il peut aller et ce qu'il garde, quand il utilise un navigateur, comment il se comporte avec un site, et les pages que vous consultez avant une exécution.
Sites qu'il connaît par leur nom
Pour quelques sites, le Crawler dispose d'une recette : une description de l'endroit où le site range ses fichiers et de la façon de passer d'une page à l'autre. Sur ces sites, l'assistant sélectionne le Crawler, et rien n'est demandé sur le type de page.
| Site | Ce que le Crawler y prend |
|---|---|
| 500px | un photographe, un flux comme celui des photos populaires, une galerie, un récit photo ou une seule photo ; le plus grand côté jusqu'à 2048 pixels |
| Bing Images | les résultats d'une recherche d'images |
| Flickr | un photostream, un album, des favoris, le pool d'un groupe, un tag, Explore, une seule photo ou une recherche ; l'original seulement là où l'auteur autorise le téléchargement, sinon la plus grande taille disponible |
| Google Images | les résultats d'une recherche d'images |
| IMDb | un film, une personne ou une galerie |
| un subreddit ou une publication |
Bing Images et Google Images sont lus avec un navigateur. Avant une exécution sur Google Images, la recherche s'ouvre pour que vous la regardiez - voir Pages que vous consultez avant une exécution.
Pour IMDb, l'assistant demande Télécharger les images et Télécharger les vidéos ; IMDb livre au plus 100 vidéos. L'assistant affiche aussi IMDb pose des conditions à l'utilisation de ses données., et le projet ne peut être créé qu'une fois que vous avez coché J'ai lu ceci.
Pour Reddit, l'assistant affiche Identifiant d'application Reddit, déjà rempli. Reddit ne répond qu'à une application enregistrée ; si vous butez sur ses limites, enregistrez la vôtre sur reddit.com/prefs/apps comme installed app et saisissez son identifiant dans le champ Identifiant d'application Reddit.
Toute autre page
Sur un site qu'il ne connaît pas par son nom, la carte du Crawler indique Fonctionne sur n'importe quelle page, mais ne sait rien de particulier sur ce site. Choisissez le Crawler, et l'assistant demande D'où viennent les fichiers ? Rien n'est sélectionné d'avance : personne d'autre que vous ne sait ce qu'est cette page.
| Choix | Ce qu'il signifie |
|---|---|
| Cette page seulement | Les fichiers liés depuis l'adresse que vous avez donnée, et rien au-delà |
| Galerie ou album | Une page portant un ensemble d'images |
| Fil de forum | Un seul sujet, avec les pièces jointes et les images des messages |
| Le site entier, ou une partie | Par défaut, seulement l'adresse que vous avez donnée et ce qui se trouve dessous |
Ensuite, Types de fichier demande quoi Télécharger : Images, case cochée par défaut, Vidéo, Audio, Documents et Archives. Un fichier dont ni l'adresse ni la réponse du site ne trahissent le type est pris quand même.
À part Jusqu'où cela peut-il aller ?, décrit plus bas, l'assistant ne demande rien d'autre ; les autres paramètres de chaque choix se trouvent sur la page Paramètres du site du projet.
Où il peut aller
Pour Le site entier, ou une partie, l'assistant demande aussi Jusqu'où cela peut-il aller ? Il énumère des zones de la plus étroite à la plus large, et le travail englobe tout ce que couvre le motif de la ligne que vous choisissez. Pour https://example.com/gallery/7/, les lignes sont example.com/gallery/7/*, example.com/gallery/*, example.com/* et *.example.com/* - le site entier avec ses sous-domaines.
La section Adresses, sur la page Paramètres du site du projet, contient le reste :
- Adresses supplémentaires - un motif d'adresse par ligne, par exemple
site.com/gallery/*. Les liens qui y correspondent appartiennent aussi au travail ; la ligne choisie dans l'assistant y est conservée en première position. - Exceptions - des motifs d'adresses où le parcours ne va pas, quelle que soit la manière dont on l'y a dirigé. Elles l'emportent sur les adresses ci-dessus.
- Nombre de pas depuis le départ - jusqu'où le parcours peut s'éloigner de l'adresse : un pas par lien suivi, 3 par défaut et 20 au plus. Une autre page de la même liste ne coûte rien, un fichier non plus.
- Liens externes - les liens qui mènent hors du travail : Les ignorer, N'en prendre que les fichiers, la valeur par défaut, ou Suivre les pages et prendre les fichiers.
- Adresses externes autorisées - vers où le parcours peut sortir ;
*, la valeur par défaut, signifie n'importe où. - Quelles adresses sont des fichiers - une règle par ligne, par exemple
site.com/get-image/* = pictures, pour un script qui sert une image ou pour un lien de téléchargement sans extension. - Règles pour suivre - vos propres conditions pour un lien, sous la forme Ne pas y aller quand ou N'y aller que quand.
Conserver les dossiers du site lui-même, sous Dossiers, classe tout comme le fait le site - l'hôte d'abord, puis les dossiers de l'adresse. Ce paramètre est désactivé par défaut, et tout se retrouve alors au même endroit.
Ce qu'il garde
La section Filtres, sur la page Paramètres du site du projet :
- Taille minimale et Taille maximale, en octets ; 0 signifie aucune limite. Un fichier dont le site n'a pas indiqué la taille est pris. Pour Fil de forum, la taille minimale vaut au départ 20480 octets : dans un message, les avatars, les émoticônes et les insignes de rang sont eux aussi des images ordinaires.
- Largeur minimale et Hauteur minimale, en pixels. La taille d'une image est inscrite dans le fichier, donc cela se décide une fois l'image récupérée : une image qui ne convient pas est supprimée, et le journal le signale.
- Règles pour garder - vos propres conditions pour un fichier, sous la forme Ne pas le prendre quand.
Pour Cette page seulement, Filtres contient aussi Quelles adresses sont des fichiers : rien n'est suivi depuis cette page, si bien qu'une adresse qui ne trahit son type que dans la réponse du site n'est jamais demandée.
Pour Galerie ou album, Pagination contient Pages d'une même liste : combien de pages de la même liste parcourir. 0, la valeur par défaut, les prend toutes - le bon choix pour un album, le mauvais pour un flux sans fin.
Quand il utilise un navigateur
Certains sites dessinent leurs pages avec du script, et sans navigateur il n'y a rien à y trouver. Utiliser un navigateur, sous Navigateur sur la page Paramètres du site du projet, propose Décider automatiquement, Oui ou Non. Laissé libre de décider, le Crawler lit la première page de chaque site des deux manières et garde celle qui a trouvé le plus ; le journal indique laquelle, avec les deux nombres. Un navigateur est des dizaines de fois plus lent.
Quand une page ne donne rien, le journal indique Rien trouvé sur … - la page a peut-être besoin d'un navigateur.
Manières
Manières, sur la page Paramètres du plugin du projet, décrit comment le Crawler se comporte avec un site :
- Secondes entre deux requêtes - la pause entre deux requêtes quelconques d'une exécution, quels que soient les sites visés, 1 par défaut et 60 au plus. Plus elle est courte, plus il est probable que le site se mette à refuser ou vous ferme ses portes ; 0 est le moyen le plus rapide de faire bannir votre adresse IP. Voir Le rythme d'une exécution.
- Conserver les pages - enregistre chaque page lue, pour que l'éditeur de recettes puisse refaire une exécution dessus sans toucher de nouveau au site. Activé par défaut.
- Utiliser les recettes - sur un site que le Crawler connaît par son nom, il suit la recette de ce site. Désactivez-le pour parcourir le site de la manière ordinaire. Activé par défaut.
- Reconnaître les hébergeurs d'images - lit un lien vers un hébergeur d'images comme une image précédée d'un saut. À désactiver si un hébergeur a changé ses pages et qu'une publicité arrive à la place d'une image. Activé par défaut.
Le Crawler récupère deux fichiers à la fois, tous sites confondus. Quand un site lui demande de ralentir, il ralentit, et le journal indique … nous a demandé de ralentir, on lève le pied. Secondes : ….
Pages que vous consultez avant une exécution
Certains sites demandent que vous fassiez d'abord quelque chose à la main : vous connecter, passer un contrôle ou affiner une recherche. Montrer la page avant une exécution, également sous Manières, décide quand la page de départ s'ouvre :
- Jamais - l'exécution démarre tout de suite.
- Quand le site le demande - la valeur par défaut. La page s'ouvre sur un site dont la recette dit qu'il a besoin de vous, comme Google Images.
- Toujours - la page s'ouvre pour chaque adresse du projet, et une seule fois pour un motif, à sa première adresse.
La page s'ouvre dans la fenêtre Vérifiez ceci avant que le téléchargement ne commence et attend. Faites ce que demande le site, puis cliquez sur Continuer : l'exécution part de la page où vous vous trouvez alors, si bien que, sur une recherche, elle conserve à la fois la requête et les filtres que vous avez posés. Annuler arrête l'exécution avant qu'elle ne démarre.
Cocher Ce site demande que je me connecte d'abord à la dernière étape de l'assistant règle ce paramètre sur Toujours.
Réparer l'analyseur
Dans l'onglet Propriétés d'un projet, au sein de la fenêtre de NeoDownloader, une carte propose Réparer l'analyseur : ce bouton ouvre l'éditeur de recettes sur la dernière exécution du projet, à l'étape qui a cessé de trouver quoi que ce soit. L'éditeur est expérimental. Avant qu'il ne s'ouvre, NeoDownloader affiche l'avertissement L'éditeur de recettes n'est pas terminé, et l'éditeur peut ne pas parvenir à réparer l'exécution.