Crawler
O Crawler percorre as páginas de um site e pega os arquivos que encontra nelas. Esta página explica quais sites ele conhece pelo nome, que tipos de página ele lê em qualquer outro site, aonde ele pode ir e o que guarda, quando usa um navegador, como trata um site e quais páginas você vê antes de uma execução.
Sites que ele conhece pelo nome
Para alguns sites, o Crawler tem uma receita: uma descrição de onde o site guarda seus arquivos e de como percorrê-los página por página. Nesses sites, o assistente seleciona o Crawler e não pergunta nada sobre o tipo de página.
| Site | O que o Crawler pega lá |
|---|---|
| 500px | um fotógrafo, um feed como o das fotos populares, uma galeria, uma história fotográfica ou uma única foto; o lado maior com até 2048 pixels |
| Bing Imagens | resultados de busca de imagens |
| Flickr | um photostream, um álbum, favoritos, o pool de um grupo, uma tag, o Explore, uma única foto ou uma busca; o original só quando o autor permite downloads, senão o maior tamanho que houver |
| Google Imagens | resultados de busca de imagens |
| IMDb | um filme, uma pessoa ou uma galeria |
| um subreddit ou um post |
O Bing Imagens e o Google Imagens são lidos por meio de um navegador. Antes de uma execução no Google Imagens, a busca abre para você dar uma olhada - veja Páginas que você vê antes de uma execução.
Para o IMDb, o assistente pergunta Baixar imagens e Baixar vídeos; o IMDb entrega no máximo 100 vídeos. O assistente também mostra O IMDb estabelece condições para o uso dos seus dados., e o projeto só pode ser criado depois que você marcar Eu li isto.
Para o Reddit, o assistente mostra o campo Id do aplicativo Reddit já preenchido. O Reddit só responde a um aplicativo registrado; se você esbarrar nos limites dele, registre o seu próprio em reddit.com/prefs/apps como installed app e digite o id desse aplicativo no campo Id do aplicativo Reddit.
Qualquer outra página
Em um site que ele não conhece pelo nome, o cartão do Crawler diz Funciona em qualquer página, mas não sabe nada em particular sobre este site. Escolha o Crawler, e o assistente pergunta De onde vêm os arquivos? Nada vem selecionado de antemão: só você sabe que página é essa.
| Opção | O que significa |
|---|---|
| Só esta página | Arquivos ligados ao endereço que você deu, e nada além |
| Galeria ou álbum | Uma página com um conjunto de imagens |
| Tópico de fórum | Um tópico, com os anexos e as imagens das mensagens |
| O site inteiro, ou uma parte dele | Por padrão, apenas o endereço que você deu e o que está abaixo dele |
Depois, em Tipos de arquivo, o assistente pergunta o que Baixar: Imagens, opção marcada por padrão, Vídeo, Áudio, Documentos e Compactados. Um arquivo cujo tipo nem o endereço nem a resposta do site revelam é pego mesmo assim.
Com exceção de Aonde isto pode ir? (veja abaixo), o assistente não pergunta mais nada; o restante das configurações de cada opção está nas Configurações do site do projeto.
Aonde ele pode ir
Para O site inteiro, ou uma parte dele, o assistente também pergunta Aonde isto pode ir? A pergunta lista áreas da mais estreita à mais ampla, e o trabalho abrange tudo o que for coberto pelo padrão da linha que você escolher. Para https://example.com/gallery/7/, as linhas são example.com/gallery/7/*, example.com/gallery/*, example.com/* e *.example.com/* - o site inteiro com seus subdomínios.
O restante fica em Endereços, nas Configurações do site do projeto:
- Endereços adicionais - um padrão de endereço por linha, como
site.com/gallery/*. Os links que combinam com eles também pertencem ao trabalho; a linha escolhida no assistente fica guardada aqui como a primeira. - Exceções - padrões de endereços aonde o percurso não vai, não importa como tenha sido direcionado a eles. Prevalecem sobre os endereços acima.
- Passos a partir do começo - até onde o percurso pode ir a partir do endereço: um passo para cada link que ele segue, 3 por padrão e no máximo 20. Outra página da mesma listagem não custa nada, e um arquivo também não.
- Links externos - links que levam para fora do trabalho: Ignorá-los, Pegar apenas os arquivos deles, que é o padrão, ou Seguir as páginas e pegar os arquivos.
- Endereços externos permitidos - para onde o percurso pode sair;
*, o valor padrão, é qualquer lugar. - Quais endereços são arquivos - uma regra por linha, como
site.com/get-image/* = pictures, para um script que serve uma imagem ou para um link de download sem extensão. - Regras para seguir - suas próprias condições para um link, na forma Não vá lá quando ou Vá lá apenas quando.
Manter as pastas do próprio site, em Pastas, organiza tudo do jeito que o site organiza - primeiro o host, depois as pastas do endereço. Por padrão vem desligado, e tudo fica junto.
O que ele guarda
Filtros, nas Configurações do site do projeto:
- Tamanho mínimo e Tamanho máximo, em bytes; 0 significa sem limite. Um arquivo cujo tamanho o site não informou é pego. Para Tópico de fórum, o tamanho mínimo vem definido como 20480 bytes: em uma mensagem, avatares, emoticons e insígnias de patente também são imagens comuns.
- Largura mínima e Altura mínima, em pixels. O tamanho de uma imagem está dentro do arquivo, então isso é decidido depois que ela é baixada: uma imagem que não couber é excluída, e o diário avisa.
- Regras para guardar - suas próprias condições para um arquivo, na forma Não pegue quando.
Para Só esta página, em Filtros há também Quais endereços são arquivos: nada é seguido a partir dessa página, então um endereço que só revela seu tipo na resposta do site nunca chega a ser pedido.
Para Galeria ou álbum, em Paginação há Páginas de uma listagem: quantas páginas da mesma listagem percorrer. 0, o padrão, significa todas - o certo para um álbum e o errado para um feed sem fim.
Quando ele usa um navegador
Alguns sites desenham suas páginas com script, e sem um navegador não há nada nelas para encontrar. Usar um navegador, em Navegador nas Configurações do site do projeto, pode ser Decidir automaticamente, Sim ou Não. Quando decide sozinho, o Crawler lê a primeira página de cada site das duas formas e fica com a que rendeu mais; o diário informa qual, com os dois números. Um navegador é dezenas de vezes mais lento.
Quando uma página não rende nada, o diário informa Nada encontrado em … - a página pode precisar de um navegador.
Boas maneiras
Em Boas maneiras, nas Configurações do plugin do projeto, fica definido como o Crawler trata um site:
- Segundos entre as requisições - a pausa entre duas requisições quaisquer de uma execução, não importa para quais sites elas vão, 1 por padrão e no máximo 60. Quanto mais curta, maior a chance de o site começar a recusar ou fechar as portas para você; 0 é o jeito mais rápido de ter o seu endereço IP banido. Veja O ritmo que uma execução mantém.
- Guardar as páginas - armazena cada página lida, para que o editor de receitas possa repetir uma execução sobre elas sem tocar no site de novo. Ligado por padrão.
- Usar receitas - em um site que o Crawler conhece pelo nome, ele segue a receita do site. Desligue para percorrer o site do jeito comum. Ligado por padrão.
- Reconhecer hospedagens de imagem - lê um link para uma hospedagem de imagens como uma imagem com um salto na frente. Vale desligar se uma hospedagem mudou suas páginas e chega uma propaganda em vez da imagem. Ligado por padrão.
O Crawler baixa dois arquivos por vez, contando todos os sites juntos. Quando um site pede para ele desacelerar, ele desacelera, e o diário informa … pediu para desacelerarmos, aliviando. Segundos: ….
Páginas que você vê antes de uma execução
Alguns sites precisam que você faça algo à mão primeiro: entrar, passar por uma verificação ou refinar uma busca. Mostrar a página antes de uma execução, também em Boas maneiras, decide quando a página inicial abre:
- Nunca - a execução começa na hora.
- Quando o site precisar - o padrão. A página abre em um site cuja receita diz que ele precisa de você, como o Google Imagens.
- Sempre - a página abre para cada endereço do projeto e, no caso de um padrão, uma vez só, no primeiro endereço dele.
A página abre na janela Verifique isto antes que o download comece e espera. Faça o que o site pede e clique em Continuar: a execução começa de onde você parou, então, em uma busca, ela mantém tanto a consulta quanto os filtros que você definiu. Cancelar faz a execução parar antes de começar.
Marcar Este site precisa que eu entre primeiro no último passo do assistente define Sempre.
Consertar o analisador
Na aba Propriedades de um projeto, na janela do NeoDownloader, um cartão oferece Consertar o analisador: ele abre o editor de receitas na última execução do projeto, no passo que passou a não encontrar nada. O editor é experimental. Antes que ele abra, o NeoDownloader avisa O editor de receitas não está pronto, e o editor pode não conseguir consertar a execução.