Crawler
Il Crawler percorre le pagine di un sito e prende i file che vi trova. Questa pagina descrive i siti che conosce per nome, i tipi di pagina che legge su qualsiasi altro sito, dove può andare e che cosa tiene, quando usa un browser, come si comporta con un sito e le pagine da guardare prima di un'esecuzione.
Siti che conosce per nome
Per alcuni siti il Crawler ha una ricetta: una descrizione di dove il sito tiene i propri file e di come scorrerne le pagine. Su questi siti la procedura guidata seleziona il Crawler, e sul tipo di pagina non chiede nulla.
| Sito | Che cosa prende lì il Crawler |
|---|---|
| 500px | un fotografo, un flusso come quello delle foto popolari, una galleria, una storia fotografica o una sola foto; il lato lungo fino a 2048 pixel |
| Bing Immagini | i risultati di una ricerca di immagini |
| Flickr | un photostream, un album, i preferiti, il pool di un gruppo, un tag, Explore, una sola foto o una ricerca; l'originale solo dove l'autore permette di scaricarlo, altrimenti la dimensione più grande disponibile |
| Google Immagini | i risultati di una ricerca di immagini |
| IMDb | un film, una persona o una galleria |
| un subreddit o un post |
Bing Immagini e Google Immagini si leggono con un browser. Prima di un'esecuzione su Google Immagini, la ricerca si apre perché lei possa guardarla - veda Pagine da guardare prima di un'esecuzione.
Per IMDb la procedura guidata chiede Scarica le immagini e Scarica i video; IMDb consegna al massimo 100 video. La procedura guidata mostra anche IMDb pone delle condizioni all'uso dei propri dati., e il progetto si può creare solo dopo che lei ha spuntato Ho letto questo.
Per Reddit la procedura guidata mostra il campo Identificativo dell'applicazione Reddit, già compilato. Reddit risponde solo a un'applicazione registrata; se si scontra con i limiti di Reddit, registri una sua applicazione su reddit.com/prefs/apps come installed app e ne inserisca l'identificativo nel campo Identificativo dell'applicazione Reddit.
Qualsiasi altra pagina
Su un sito che non conosce per nome, il riquadro del Crawler riporta Funziona su qualsiasi pagina, ma non sa nulla di particolare su questo sito. Scelga il Crawler, e la procedura guidata chiede Da dove vengono i file? Non c'è nulla di preselezionato: che pagina sia, lo sa solo lei.
| Scelta | Che cosa significa |
|---|---|
| Solo questa pagina | I file collegati dall'indirizzo che ha dato, e nulla oltre |
| Galleria o album | Una pagina con sopra un insieme di immagini |
| Discussione di forum | Un solo argomento, con gli allegati e le immagini dei messaggi |
| L'intero sito, o una parte | Per impostazione predefinita solo l'indirizzo che ha dato e ciò che gli sta sotto |
Poi Tipi di file chiede che cosa scaricare, alla voce Scarica: Immagini, spuntate per impostazione predefinita, Video, Audio, Documenti e Archivi. Un file di cui né l'indirizzo né la risposta del sito tradiscono il tipo viene preso lo stesso.
A parte la domanda Fin dove può arrivare?, descritta più sotto, la procedura guidata non chiede altro; le altre impostazioni di ciascuna scelta sono nelle Impostazioni del sito del progetto.
Dove può andare
Per L'intero sito, o una parte, la procedura guidata chiede anche Fin dove può arrivare? Elenca delle aree dalla più stretta alla più ampia, e il lavoro comprende tutto ciò che è coperto dal modello della riga che sceglie. Per https://example.com/gallery/7/ le righe sono example.com/gallery/7/*, example.com/gallery/*, example.com/* e *.example.com/* - l'intero sito con i suoi sottodomini.
La sezione Indirizzi delle Impostazioni del sito del progetto contiene il resto:
- Indirizzi aggiuntivi - un modello di indirizzo per riga, per esempio
site.com/gallery/*. Anche i collegamenti che vi corrispondono appartengono al lavoro; la riga scelta nella procedura guidata si trova qui, al primo posto. - Eccezioni - modelli di indirizzi dove il percorso non va, comunque ci sia stato indirizzato. Prevalgono sugli indirizzi qui sopra.
- Passi dalla partenza - fin dove il percorso può allontanarsi dall'indirizzo: un passo per ogni collegamento che segue, 3 per impostazione predefinita e al massimo 20. Un'altra pagina dello stesso elenco non costa nulla, e nemmeno un file.
- Collegamenti esterni - i collegamenti che portano fuori dal lavoro: Ignorali, Prendine solo i file, che è il valore predefinito, oppure Segui le pagine e prendi i file.
- Indirizzi esterni permessi - verso dove il percorso può uscire;
*, il valore predefinito, significa ovunque. - Quali indirizzi sono file - una regola per riga, per esempio
site.com/get-image/* = pictures, per uno script che serve un'immagine o per un collegamento di scaricamento senza estensione. - Regole per seguire - le sue condizioni per un collegamento, nella forma Non andarci quando o Andarci solo quando.
Conserva le cartelle del sito stesso, sotto Cartelle, ordina tutto come lo ordina il sito - prima l'host, poi le cartelle dell'indirizzo. Per impostazione predefinita è disattivata, e tutto finisce nello stesso posto.
Che cosa tiene
La sezione Filtri delle Impostazioni del sito del progetto:
- Dimensione minima e Dimensione massima, in byte; 0 significa nessun limite. Un file di cui il sito non ha indicato la dimensione viene preso. Per Discussione di forum la dimensione minima è preimpostata a 20480 byte: in un messaggio anche avatar, faccine e distintivi di grado sono immagini ordinarie.
- Larghezza minima e Altezza minima, in pixel. La dimensione di un'immagine sta dentro il file, quindi questo si decide dopo averla scaricata: un'immagine che non va bene viene eliminata, e il diario lo segnala.
- Regole per tenere - le sue condizioni per un file, nella forma Non prenderlo quando.
Per Solo questa pagina, la sezione Filtri contiene anche Quali indirizzi sono file: da quella pagina non si segue nulla, quindi un indirizzo che tradisce il proprio tipo solo nella risposta del sito non viene mai richiesto.
Per Galleria o album, la sezione Impaginazione contiene Pagine di uno stesso elenco: quante pagine dello stesso elenco percorrere. 0, il valore predefinito, vuol dire tutte - la scelta giusta per un album e quella sbagliata per un flusso senza fine.
Quando usa un browser
Certi siti disegnano le proprie pagine con degli script, e senza un browser non c'è nulla da trovarci. Usa un browser, sotto Browser nelle Impostazioni del sito del progetto, può valere Decidi automaticamente, Sì o No. Lasciato libero di decidere, il Crawler legge la prima pagina di ogni sito in entrambi i modi e tiene quello con cui ha trovato di più; il diario riporta quale, con tutti e due i numeri. Un browser è decine di volte più lento.
Quando una pagina non dà nulla, il diario riporta Niente trovato su … - la pagina potrebbe aver bisogno di un browser.
Buone maniere
La sezione Buone maniere delle Impostazioni del plugin del progetto stabilisce come il Crawler si comporta con un sito:
- Secondi fra due richieste - la pausa fra due richieste qualsiasi di un'esecuzione, a qualunque sito siano dirette, 1 per impostazione predefinita e al massimo 60. Più è breve, più è probabile che il sito cominci a rifiutare o che le chiuda le porte; 0 è il modo più rapido di farsi bloccare l'indirizzo IP. Veda Il ritmo di un'esecuzione.
- Conserva le pagine - salva ogni pagina letta, così l'editor delle ricette può ripetere un'esecuzione su quelle pagine senza toccare di nuovo il sito. Attivata per impostazione predefinita.
- Usa le ricette - su un sito che il Crawler conosce per nome, segue la ricetta di quel sito. La disattivi per percorrere il sito nel modo ordinario. Attivata per impostazione predefinita.
- Riconosci gli host di immagini - legge un collegamento a un host di immagini come un'immagine con un salto davanti. Conviene disattivarla se un host ha cambiato le sue pagine e al posto di un'immagine arriva una pubblicità. Attivata per impostazione predefinita.
Il Crawler scarica due file alla volta, contando tutti i siti insieme. Quando un sito gli chiede di rallentare, rallenta, e il diario riporta … ci ha chiesto di rallentare, alleggeriamo. Secondi: ….
Pagine da guardare prima di un'esecuzione
Certi siti richiedono che lei faccia prima qualcosa a mano: accedere, superare un controllo o restringere una ricerca. Mostra la pagina prima di un'esecuzione, anche questa sotto Buone maniere, decide quando si apre la pagina di partenza:
- Mai - l'esecuzione parte subito.
- Quando il sito lo richiede - il valore predefinito. La pagina si apre su un sito la cui ricetta dice che ha bisogno di lei, come Google Immagini.
- Sempre - la pagina si apre per ogni indirizzo del progetto, e una sola volta per un modello, al suo primo indirizzo.
La pagina si apre nella finestra Controlli questo prima che lo scaricamento cominci e aspetta. Faccia ciò che serve al sito, poi faccia clic su Continua: l'esecuzione parte dalla pagina in cui lei si trova a quel punto, quindi su una ricerca conserva sia i termini cercati sia i filtri che ha impostato. Annulla ferma l'esecuzione prima che parta.
Spuntare Questo sito richiede che io acceda prima all'ultimo passo della procedura guidata imposta Sempre.
Ripara l'analizzatore
Nella scheda Proprietà di un progetto, nella finestra di NeoDownloader, un riquadro propone Ripara l'analizzatore: il pulsante apre l'editor delle ricette sull'ultima esecuzione del progetto, al passo che ha smesso di trovare qualcosa. L'editor è sperimentale. Prima che si apra, NeoDownloader avvisa L'editor delle ricette non è finito, e l'editor potrebbe non riuscire a riparare l'esecuzione.