Temas de ayuda
Todos los temas de ayuda

Crawler

El Crawler recorre las páginas de un sitio y se lleva los archivos que encuentra en ellas. Esta página trata de los sitios que conoce por su nombre, los tipos de página que lee en cualquier otro sitio, adónde puede ir y qué conserva, cuándo usa un navegador, cómo trata a un sitio y las páginas que usted revisa antes de una ejecución.

Sitios que conoce por su nombre

Para unos cuantos sitios, el Crawler tiene una receta: una descripción de dónde guarda el sitio sus archivos y de cómo recorrerlos página a página. En estos sitios el asistente selecciona el Crawler y no pregunta nada sobre el tipo de página.

Sitio Qué toma allí el Crawler
500px un fotógrafo, un feed como el de las fotos populares, una galería, una historia fotográfica o una sola foto; con el lado largo de hasta 2048 píxeles
Bing Imágenes resultados de búsqueda de imágenes
Flickr un photostream, un álbum, favoritos, el pool de un grupo, una etiqueta, Explore, una sola foto o una búsqueda; el original solo donde el autor permite descargas y, si no, el mayor tamaño que haya
Google Imágenes resultados de búsqueda de imágenes
IMDb una película, una persona o una galería
Reddit un subreddit o una publicación

Bing Imágenes y Google Imágenes se leen a través de un navegador. Antes de una ejecución en Google Imágenes, la búsqueda se abre para que usted la revise - consulte Páginas que usted revisa antes de una ejecución.

Para IMDb, el asistente pregunta Descargar imágenes y Descargar vídeos; IMDb entrega como mucho 100 vídeos. El asistente muestra también IMDb establece condiciones para el uso de sus datos., y el proyecto solo se puede crear después de marcar He leído esto.

Para Reddit, el asistente muestra el campo Id de aplicación de Reddit ya rellenado. Reddit solo responde a una aplicación registrada; si se topa con sus límites, registre la suya en reddit.com/prefs/apps como installed app y escriba su id en Id de aplicación de Reddit.

Cualquier otra página

En un sitio que no conoce por su nombre, la tarjeta del Crawler dice Funciona en cualquier página, pero no sabe nada en particular sobre este sitio. Elija el Crawler y el asistente preguntará ¿De dónde vienen los archivos? No hay nada seleccionado de antemano: solo usted sabe qué clase de página es.

Opción Qué significa
Solo esta página Los archivos enlazados desde la dirección que usted indicó, y nada más allá
Galería o álbum Una página con un conjunto de imágenes
Hilo de foro Un solo tema, con los adjuntos y las imágenes de los mensajes
El sitio entero, o una parte de él De forma predeterminada, solo la dirección que usted indicó y lo que queda por debajo de ella

Después, la página Tipos de archivo pregunta qué Descargar: Imágenes, Vídeo, Audio, Documentos y Archivos comprimidos, con la casilla Imágenes marcada de forma predeterminada. Un archivo cuyo tipo no delatan ni su dirección ni la respuesta del sitio se toma igualmente.

Aparte de ¿Hasta dónde puede llegar esto?, que se describe más abajo, el asistente no pregunta nada más; el resto de los ajustes de cada opción está en los Ajustes del sitio del proyecto.

Adónde puede ir

Para El sitio entero, o una parte de él, el asistente pregunta además ¿Hasta dónde puede llegar esto? Enumera zonas de la más estrecha a la más amplia, y pertenece al trabajo todo lo que abarca el patrón de la línea que usted elija. Para https://example.com/gallery/7/ las líneas son example.com/gallery/7/*, example.com/gallery/*, example.com/* y *.example.com/* - el sitio entero con sus subdominios.

La sección Direcciones de los Ajustes del sitio del proyecto contiene el resto:

  • Direcciones adicionales - un patrón de dirección por línea, como site.com/gallery/*. Los enlaces que coinciden con ellos también pertenecen al trabajo; la línea elegida en el asistente se guarda aquí como la primera.
  • Excepciones - patrones de direcciones a las que el recorrido no va, aunque algo lo dirija hacia ellas. Prevalecen sobre las direcciones de arriba.
  • Pasos desde el principio - hasta dónde puede alejarse el recorrido de la dirección: un paso por cada enlace que sigue, 3 de forma predeterminada y 20 como máximo. Otra página de la misma lista no cuesta nada, y un archivo tampoco.
  • Enlaces externos - enlaces que llevan fuera del trabajo: Ignorarlos, Tomar de ellos solo los archivos, que es la opción predeterminada, o Seguir las páginas y tomar los archivos.
  • Direcciones externas permitidas - hacia dónde puede salir el recorrido; *, el valor predeterminado, significa a cualquier parte.
  • Qué direcciones son archivos - una regla por línea, como site.com/get-image/* = pictures, para un script que sirve una imagen o para un enlace de descarga sin extensión.
  • Reglas para seguir enlaces - sus propias condiciones para un enlace, en forma de No ir allí cuando o Ir allí solo cuando.

Conservar las carpetas del propio sitio, en la sección Carpetas, guarda todo tal como lo organiza el sitio - primero el servidor, después las carpetas de la dirección. De forma predeterminada está desactivado, y todo se guarda junto.

Qué conserva

Filtros, en los Ajustes del sitio del proyecto:

  • Tamaño mínimo y Tamaño máximo, en bytes; 0 significa sin límite. Un archivo cuyo tamaño no indicó el sitio se toma. Para Hilo de foro, el tamaño mínimo viene fijado en 20480 bytes: en un mensaje, los avatares, los emoticonos y las insignias de rango también son imágenes normales.
  • Anchura mínima y Altura mínima, en píxeles. El tamaño de una imagen está dentro del archivo, así que esto se decide después de traerla: una imagen que no cumple se elimina, y el registro lo indica.
  • Reglas para quedárselo - sus propias condiciones para un archivo, en forma de No tomarlo cuando.

En Solo esta página, la sección Filtros tiene además Qué direcciones son archivos: desde esa página no se sigue nada, así que una dirección que solo delata su tipo en la respuesta del sitio no se llega a pedir nunca.

En Galería o álbum, la sección Paginación tiene Páginas de una misma lista: cuántas páginas de la misma lista recorrer. 0, el valor predeterminado, significa todas - lo correcto para un álbum y lo equivocado para un feed sin fin.

Cuándo usa un navegador

Algunos sitios dibujan sus páginas con script, y sin navegador no hay nada que encontrar en ellas. Usar un navegador, en la sección Navegador de los Ajustes del sitio del proyecto, puede ser Decidir automáticamente, o No. Si se le deja decidir, el Crawler lee la primera página de cada sitio de las dos maneras y se queda con la que encontró más; el registro indica cuál, con las dos cifras. Un navegador es decenas de veces más lento.

Cuando una página no da nada, el registro indica No se encontró nada en … - puede que la página necesite un navegador.

Modales

Modales, en los Ajustes del plugin del proyecto, determina cómo trata el Crawler a un sitio:

  • Segundos entre peticiones - la pausa entre dos peticiones cualesquiera de una ejecución, vayan al sitio que vayan, 1 de forma predeterminada y 60 como máximo. Cuanto más corta, más probable es que el sitio empiece a rechazarlas o que le cierre las puertas; 0 es la forma más rápida de que le bloqueen la dirección IP. Consulte El ritmo que mantiene una ejecución.
  • Guardar las páginas - conserva cada página leída, para que el editor de recetas pueda repetir una ejecución sobre ellas sin volver a tocar el sitio. Activado de forma predeterminada.
  • Usar recetas - en un sitio que el Crawler conoce por su nombre, sigue la receta de ese sitio. Desactívelo para recorrer el sitio de la forma normal. Activado de forma predeterminada.
  • Reconocer los alojamientos de imágenes - trata un enlace a un alojamiento de imágenes como una imagen con un salto intermedio. Conviene desactivarlo si un alojamiento ha cambiado sus páginas y llega un anuncio en lugar de una imagen. Activado de forma predeterminada.

El Crawler descarga dos archivos a la vez, contando todos los sitios juntos. Cuando un sitio le pide que vaya más despacio, lo hace, y el registro indica … nos pidió ir más despacio, aflojamos. Segundos: ….

Páginas que usted revisa antes de una ejecución

Algunos sitios necesitan que usted haga algo a mano primero: iniciar sesión, pasar una comprobación o acotar una búsqueda. Mostrar la página antes de una ejecución, también en Modales, decide cuándo se abre la página de partida:

  • Nunca - la ejecución empieza enseguida.
  • Cuando el sitio lo necesita - la opción predeterminada. La página se abre en un sitio cuya receta dice que le necesita a usted, como Google Imágenes.
  • Siempre - la página se abre para cada dirección del proyecto, y una sola vez para un patrón, en su primera dirección.

La página se abre en la ventana Compruebe esto antes de que empiece la descarga y espera. Haga lo que necesite el sitio y luego haga clic en Continuar: la ejecución empieza desde donde usted haya acabado, así que en una búsqueda conserva tanto la consulta como los filtros que puso. Cancelar detiene la ejecución antes de que empiece.

Marcar Este sitio necesita que inicie sesión primero en el último paso del asistente selecciona Siempre.

Reparar el analizador

En la pestaña Propiedades de un proyecto, en la ventana de NeoDownloader, una tarjeta ofrece Reparar el analizador: abre el editor de recetas en la última ejecución del proyecto, en el paso que ya no encontró nada. El editor es experimental. Antes de que se abra, NeoDownloader avisa: El editor de recetas no está terminado, y puede que el editor no consiga reparar la ejecución.