Tópicos de ajuda
Todos os tópicos de ajuda

Crawler

O Crawler percorre as páginas de um site e pega os arquivos que encontra nelas. Esta página explica quais sites ele conhece pelo nome, que tipos de página ele lê em qualquer outro site, aonde ele pode ir e o que guarda, quando usa um navegador, como trata um site e quais páginas você vê antes de uma execução.

Sites que ele conhece pelo nome

Para alguns sites, o Crawler tem uma receita: uma descrição de onde o site guarda seus arquivos e de como percorrê-los página por página. Nesses sites, o assistente seleciona o Crawler e não pergunta nada sobre o tipo de página.

Site O que o Crawler pega lá
500px um fotógrafo, um feed como o das fotos populares, uma galeria, uma história fotográfica ou uma única foto; o lado maior com até 2048 pixels
Bing Imagens resultados de busca de imagens
Flickr um photostream, um álbum, favoritos, o pool de um grupo, uma tag, o Explore, uma única foto ou uma busca; o original só quando o autor permite downloads, senão o maior tamanho que houver
Google Imagens resultados de busca de imagens
IMDb um filme, uma pessoa ou uma galeria
Reddit um subreddit ou um post

O Bing Imagens e o Google Imagens são lidos por meio de um navegador. Antes de uma execução no Google Imagens, a busca abre para você dar uma olhada - veja Páginas que você vê antes de uma execução.

Para o IMDb, o assistente pergunta Baixar imagens e Baixar vídeos; o IMDb entrega no máximo 100 vídeos. O assistente também mostra O IMDb estabelece condições para o uso dos seus dados., e o projeto só pode ser criado depois que você marcar Eu li isto.

Para o Reddit, o assistente mostra o campo Id do aplicativo Reddit já preenchido. O Reddit só responde a um aplicativo registrado; se você esbarrar nos limites dele, registre o seu próprio em reddit.com/prefs/apps como installed app e digite o id desse aplicativo no campo Id do aplicativo Reddit.

Qualquer outra página

Em um site que ele não conhece pelo nome, o cartão do Crawler diz Funciona em qualquer página, mas não sabe nada em particular sobre este site. Escolha o Crawler, e o assistente pergunta De onde vêm os arquivos? Nada vem selecionado de antemão: só você sabe que página é essa.

Opção O que significa
Só esta página Arquivos ligados ao endereço que você deu, e nada além
Galeria ou álbum Uma página com um conjunto de imagens
Tópico de fórum Um tópico, com os anexos e as imagens das mensagens
O site inteiro, ou uma parte dele Por padrão, apenas o endereço que você deu e o que está abaixo dele

Depois, em Tipos de arquivo, o assistente pergunta o que Baixar: Imagens, opção marcada por padrão, Vídeo, Áudio, Documentos e Compactados. Um arquivo cujo tipo nem o endereço nem a resposta do site revelam é pego mesmo assim.

Com exceção de Aonde isto pode ir? (veja abaixo), o assistente não pergunta mais nada; o restante das configurações de cada opção está nas Configurações do site do projeto.

Aonde ele pode ir

Para O site inteiro, ou uma parte dele, o assistente também pergunta Aonde isto pode ir? A pergunta lista áreas da mais estreita à mais ampla, e o trabalho abrange tudo o que for coberto pelo padrão da linha que você escolher. Para https://example.com/gallery/7/, as linhas são example.com/gallery/7/*, example.com/gallery/*, example.com/* e *.example.com/* - o site inteiro com seus subdomínios.

O restante fica em Endereços, nas Configurações do site do projeto:

  • Endereços adicionais - um padrão de endereço por linha, como site.com/gallery/*. Os links que combinam com eles também pertencem ao trabalho; a linha escolhida no assistente fica guardada aqui como a primeira.
  • Exceções - padrões de endereços aonde o percurso não vai, não importa como tenha sido direcionado a eles. Prevalecem sobre os endereços acima.
  • Passos a partir do começo - até onde o percurso pode ir a partir do endereço: um passo para cada link que ele segue, 3 por padrão e no máximo 20. Outra página da mesma listagem não custa nada, e um arquivo também não.
  • Links externos - links que levam para fora do trabalho: Ignorá-los, Pegar apenas os arquivos deles, que é o padrão, ou Seguir as páginas e pegar os arquivos.
  • Endereços externos permitidos - para onde o percurso pode sair; *, o valor padrão, é qualquer lugar.
  • Quais endereços são arquivos - uma regra por linha, como site.com/get-image/* = pictures, para um script que serve uma imagem ou para um link de download sem extensão.
  • Regras para seguir - suas próprias condições para um link, na forma Não vá lá quando ou Vá lá apenas quando.

Manter as pastas do próprio site, em Pastas, organiza tudo do jeito que o site organiza - primeiro o host, depois as pastas do endereço. Por padrão vem desligado, e tudo fica junto.

O que ele guarda

Filtros, nas Configurações do site do projeto:

  • Tamanho mínimo e Tamanho máximo, em bytes; 0 significa sem limite. Um arquivo cujo tamanho o site não informou é pego. Para Tópico de fórum, o tamanho mínimo vem definido como 20480 bytes: em uma mensagem, avatares, emoticons e insígnias de patente também são imagens comuns.
  • Largura mínima e Altura mínima, em pixels. O tamanho de uma imagem está dentro do arquivo, então isso é decidido depois que ela é baixada: uma imagem que não couber é excluída, e o diário avisa.
  • Regras para guardar - suas próprias condições para um arquivo, na forma Não pegue quando.

Para Só esta página, em Filtros há também Quais endereços são arquivos: nada é seguido a partir dessa página, então um endereço que só revela seu tipo na resposta do site nunca chega a ser pedido.

Para Galeria ou álbum, em PaginaçãoPáginas de uma listagem: quantas páginas da mesma listagem percorrer. 0, o padrão, significa todas - o certo para um álbum e o errado para um feed sem fim.

Quando ele usa um navegador

Alguns sites desenham suas páginas com script, e sem um navegador não há nada nelas para encontrar. Usar um navegador, em Navegador nas Configurações do site do projeto, pode ser Decidir automaticamente, Sim ou Não. Quando decide sozinho, o Crawler lê a primeira página de cada site das duas formas e fica com a que rendeu mais; o diário informa qual, com os dois números. Um navegador é dezenas de vezes mais lento.

Quando uma página não rende nada, o diário informa Nada encontrado em … - a página pode precisar de um navegador.

Boas maneiras

Em Boas maneiras, nas Configurações do plugin do projeto, fica definido como o Crawler trata um site:

  • Segundos entre as requisições - a pausa entre duas requisições quaisquer de uma execução, não importa para quais sites elas vão, 1 por padrão e no máximo 60. Quanto mais curta, maior a chance de o site começar a recusar ou fechar as portas para você; 0 é o jeito mais rápido de ter o seu endereço IP banido. Veja O ritmo que uma execução mantém.
  • Guardar as páginas - armazena cada página lida, para que o editor de receitas possa repetir uma execução sobre elas sem tocar no site de novo. Ligado por padrão.
  • Usar receitas - em um site que o Crawler conhece pelo nome, ele segue a receita do site. Desligue para percorrer o site do jeito comum. Ligado por padrão.
  • Reconhecer hospedagens de imagem - lê um link para uma hospedagem de imagens como uma imagem com um salto na frente. Vale desligar se uma hospedagem mudou suas páginas e chega uma propaganda em vez da imagem. Ligado por padrão.

O Crawler baixa dois arquivos por vez, contando todos os sites juntos. Quando um site pede para ele desacelerar, ele desacelera, e o diário informa … pediu para desacelerarmos, aliviando. Segundos: ….

Páginas que você vê antes de uma execução

Alguns sites precisam que você faça algo à mão primeiro: entrar, passar por uma verificação ou refinar uma busca. Mostrar a página antes de uma execução, também em Boas maneiras, decide quando a página inicial abre:

  • Nunca - a execução começa na hora.
  • Quando o site precisar - o padrão. A página abre em um site cuja receita diz que ele precisa de você, como o Google Imagens.
  • Sempre - a página abre para cada endereço do projeto e, no caso de um padrão, uma vez só, no primeiro endereço dele.

A página abre na janela Verifique isto antes que o download comece e espera. Faça o que o site pede e clique em Continuar: a execução começa de onde você parou, então, em uma busca, ela mantém tanto a consulta quanto os filtros que você definiu. Cancelar faz a execução parar antes de começar.

Marcar Este site precisa que eu entre primeiro no último passo do assistente define Sempre.

Consertar o analisador

Na aba Propriedades de um projeto, na janela do NeoDownloader, um cartão oferece Consertar o analisador: ele abre o editor de receitas na última execução do projeto, no passo que passou a não encontrar nada. O editor é experimental. Antes que ele abra, o NeoDownloader avisa O editor de receitas não está pronto, e o editor pode não conseguir consertar a execução.