도움말 주제
모든 도움말 주제

Crawler

Crawler는 사이트의 페이지를 돌아다니며 그 페이지에서 찾은 파일을 가져옵니다. 이 페이지에서는 Crawler가 개별적으로 아는 사이트, 그 밖의 곳에서 읽는 페이지 종류, 갈 수 있는 곳과 남기는 것, 브라우저를 쓰는 경우, 사이트를 대하는 방식, 그리고 실행 전에 살펴보는 페이지를 다룹니다.

개별적으로 아는 사이트

몇몇 사이트에는 Crawler용 레시피가 있습니다. 레시피는 사이트가 파일을 어디에 두는지, 그 페이지를 어떻게 넘기는지를 적은 설명입니다. 이런 사이트에서는 마법사가 Crawler를 선택하며, 페이지 종류는 묻지 않습니다.

사이트 Crawler가 가져오는 것
500px 사진가, 인기 사진 같은 피드, 갤러리, 포토 스토리 또는 사진 한 장. 크기는 긴 변 기준 최대 2048픽셀
Bing Images 이미지 검색 결과
Flickr 사진 스트림, 앨범, 즐겨찾기, 그룹 풀, 태그, Explore, 사진 한 장 또는 검색. 원본은 작성자가 내려받기를 허용한 경우에만, 그렇지 않으면 제공되는 가장 큰 크기
Google 이미지 이미지 검색 결과
IMDb 영화, 인물 또는 갤러리
Reddit 서브레딧 또는 게시물

Bing Images와 Google 이미지는 브라우저로 읽습니다. Google 이미지에서는 실행 전에 검색 페이지가 열려 직접 살펴볼 수 있습니다. 실행 전에 살펴보는 페이지를 참고하세요.

IMDb에서는 마법사가 ‘그림 내려받기’와 ‘동영상 내려받기’를 묻습니다. IMDb가 내주는 동영상은 최대 100개입니다. 또한 ‘IMDb는 자사 데이터의 이용에 조건을 두고 있습니다.’라는 안내가 나오며, ‘읽었습니다’에 체크해야 프로젝트를 만들 수 있습니다.

Reddit에서는 마법사에 ‘Reddit 애플리케이션 ID’ 칸이 이미 채워진 채로 나옵니다. Reddit은 등록된 애플리케이션에만 응답합니다. 한도에 걸리면 reddit.com/prefs/apps에서 installed app 유형으로 직접 애플리케이션을 등록하고, 그 ID를 ‘Reddit 애플리케이션 ID’ 칸에 입력하세요.

그 밖의 페이지

Crawler가 개별적으로 알지 못하는 사이트에서는 Crawler 카드에 ‘어떤 페이지에서도 동작하지만, 이 사이트에 대한 개별 지식은 없습니다’라고 나옵니다. Crawler를 고르면 마법사가 ‘파일은 어디에서 오나요?’라고 묻습니다. 미리 선택된 것은 없습니다. 페이지가 어떤 페이지인지는 여러분만 알기 때문입니다.

선택지
이 페이지만 입력한 주소에서 링크된 파일, 그 너머는 없음
갤러리 또는 앨범 그림이 한데 모여 있는 페이지
포럼 스레드 주제 하나와 그 게시물에 있는 첨부 파일 및 그림
사이트 전체, 또는 그 일부 기본값으로는 입력한 주소와 그 아래에 있는 것만

이어서 ‘파일 종류’에서 ‘내려받기’ 대상을 묻습니다. 기본값으로 체크되어 있는 ‘그림’ 외에 ‘동영상’, ‘소리’, ‘문서’, ‘압축 파일’이 있습니다. 주소로도 사이트의 응답으로도 종류가 드러나지 않는 파일은 그래도 가져옵니다.

아래에서 다루는 ‘어디까지 갈 수 있는가’ 말고는 마법사가 더 묻지 않습니다. 선택지마다 나머지 설정은 프로젝트의 ‘사이트 설정’에 있습니다.

갈 수 있는 곳

사이트 전체, 또는 그 일부’에서는 마법사가 ‘어디까지 갈 수 있는가’도 묻습니다. 범위가 가장 좁은 것부터 가장 넓은 것 순으로 나오며, 고른 줄의 패턴에 해당하는 것은 모두 작업에 들어갑니다. https://example.com/gallery/7/의 경우 줄은 example.com/gallery/7/*, example.com/gallery/*, example.com/*, 그리고 하위 도메인까지 포함한 사이트 전체인 *.example.com/*입니다.

나머지는 프로젝트 ‘사이트 설정’의 ‘주소’에 있습니다.

  • 추가 주소 - 한 줄에 하나씩 적는 주소 패턴(예: site.com/gallery/*)입니다. 여기에 맞는 링크도 작업에 속합니다. 마법사에서 고른 줄은 여기에 첫 줄로 들어가 있습니다.
  • 예외 - 어떤 경로로 그 주소를 알게 되었든 크롤이 가지 않는 주소의 패턴입니다. 위의 주소보다 우선합니다.
  • 시작 지점에서의 걸음 수 - 크롤이 주소에서 얼마나 멀리 갈 수 있는지입니다. 링크를 하나 따라갈 때마다 한 걸음이며, 기본값은 3, 최대 20입니다. 같은 목록의 다른 페이지로 넘어가는 데는 걸음이 들지 않고, 파일도 마찬가지입니다.
  • 외부 링크 - 작업 밖으로 이어지는 링크를 어떻게 다룰지입니다. ‘무시하기’, 기본값인 ‘파일만 가져오기’, ‘페이지를 따라가고 파일도 가져오기’ 중에서 고릅니다.
  • 허용할 외부 주소 - 크롤이 밖으로 나갈 수 있는 곳입니다. 기본값인 *는 모든 곳을 뜻합니다.
  • 어떤 주소가 파일인지 - 한 줄에 하나씩 적는 규칙(예: site.com/get-image/* = pictures)으로, 그림을 내주는 스크립트나 확장자가 없는 내려받기 링크에 씁니다.
  • 따라가기 위한 규칙 - 링크에 대해 직접 정하는 조건으로, ‘다음일 때는 가지 않기’ 또는 ‘다음일 때만 가기’ 형태입니다.

폴더’에 있는 ‘사이트의 폴더 구성 유지’는 모든 파일을 사이트와 같은 방식으로 정리합니다. 맨 위에 호스트, 그 아래에 주소의 폴더가 옵니다. 기본값으로 꺼져 있으며, 이때는 모든 파일이 한곳에 모입니다.

남기는 것

프로젝트 ‘사이트 설정’의 ‘필터’에는 다음 설정이 있습니다.

  • 최소 크기’와 ‘최대 크기’는 바이트 단위이며, 0은 제한이 없다는 뜻입니다. 사이트가 크기를 밝히지 않은 파일은 가져옵니다. ‘포럼 스레드’에서는 최소 크기가 처음부터 20480바이트입니다. 게시물 안에서는 아바타, 이모티콘, 등급 배지도 평범한 그림이기 때문입니다.
  • 최소 너비’와 ‘최소 높이’는 픽셀 단위입니다. 그림의 크기는 파일 안에 들어 있으므로 이 판단은 파일을 내려받은 뒤에 합니다. 맞지 않는 그림은 삭제되며, 기록에 그렇게 남습니다.
  • 남기기 위한 규칙 - 파일에 대해 직접 정하는 조건으로, ‘다음일 때는 가져오지 않기’ 형태입니다.

이 페이지만’에서는 ‘필터’에 ‘어떤 주소가 파일인지’도 있습니다. 그 페이지에서는 아무것도 따라가지 않으므로, 사이트의 응답에서만 종류가 드러나는 주소는 한 번도 요청되지 않기 때문입니다.

갤러리 또는 앨범’에서는 ‘페이지 넘기기’에 ‘한 목록의 페이지 수’가 있습니다. 같은 목록에서 몇 페이지까지 돌지 정합니다. 기본값인 0은 전부를 뜻하며, 앨범에는 맞고 끝없이 이어지는 피드에는 맞지 않습니다.

브라우저를 쓰는 경우

어떤 사이트는 스크립트로 페이지를 그리기 때문에, 브라우저 없이는 찾을 것이 아무것도 없습니다. 프로젝트 ‘사이트 설정’의 ‘브라우저’ 아래에 있는 ‘브라우저 사용’은 ‘자동으로 판단’, ‘’, ‘아니요’ 중 하나입니다. 자동으로 판단하게 두면 Crawler는 사이트마다 첫 페이지를 두 방식으로 모두 읽고 더 많이 찾은 쪽을 씁니다. 어느 쪽인지는 두 숫자와 함께 기록에 남습니다. 브라우저는 수십 배 느립니다.

페이지에서 아무것도 나오지 않으면 기록에 ‘…에서 아무것도 찾지 못했습니다. 이 페이지에는 브라우저가 필요할 수 있습니다’라고 남습니다.

예절

프로젝트 ‘플러그인 설정’에 있는 ‘예절’은 Crawler가 사이트를 대하는 방식입니다.

  • 요청 사이의 간격(초) - 한 실행의 두 요청 사이에 두는 간격으로, 요청이 어느 사이트로 가든 똑같이 적용됩니다. 기본값은 1, 최대 60입니다. 짧을수록 사이트가 요청을 거절하기 시작하거나 접속을 막아 버릴 가능성이 커지며, 0은 IP 주소가 차단되는 가장 빠른 길입니다. 실행이 지키는 속도를 참고하세요.
  • 페이지를 보관하기 - 읽은 페이지를 모두 저장해 두어, 레시피 편집기가 사이트에 다시 접속하지 않고도 그 페이지로 실행을 되풀이할 수 있게 합니다. 기본값으로 켜져 있습니다.
  • 레시피 사용 - Crawler가 개별적으로 아는 사이트에서는 그 사이트의 레시피를 따릅니다. 사이트를 일반적인 방식으로 돌게 하려면 끄세요. 기본값으로 켜져 있습니다.
  • 이미지 호스트 알아보기 - 이미지 호스트로 가는 링크를 한 번 거쳐야 닿는 그림으로 읽습니다. 호스트가 페이지를 바꾸는 바람에 그림 대신 광고가 들어온다면 꺼 볼 만합니다. 기본값으로 켜져 있습니다.

Crawler는 모든 사이트를 통틀어 한 번에 파일 두 개씩 내려받습니다. 사이트가 속도를 늦춰 달라고 하면 그대로 늦추며, 기록에 ‘…이(가) 속도를 늦춰 달라고 해서 늦춥니다. 초: …’라고 남습니다.

실행 전에 살펴보는 페이지

어떤 사이트는 먼저 직접 손을 써야 합니다. 로그인하거나, 확인 절차를 통과하거나, 검색 범위를 좁혀야 하는 경우입니다. 역시 ‘예절’에 있는 ‘실행 전에 페이지 보여 주기’는 시작 페이지가 언제 열릴지 정합니다.

  • 안 함 - 실행이 곧바로 시작됩니다.
  • 사이트가 필요로 할 때 - 기본값입니다. Google 이미지처럼 레시피에 직접 확인이 필요하다고 적힌 사이트에서 페이지가 열립니다.
  • 항상 - 프로젝트의 주소마다 페이지가 열리고, 패턴은 첫 주소에서 한 번 열립니다.

페이지는 ‘내려받기를 시작하기 전에 확인하세요’ 창에서 열리고 기다립니다. 사이트가 요구하는 일을 마친 뒤 ‘계속’을 누르세요. 실행은 마지막으로 머문 곳에서 시작하므로, 검색이라면 검색어와 설정한 필터가 모두 유지됩니다. ‘취소’는 실행을 시작하기 전에 멈춥니다.

마법사의 마지막 단계에서 ‘이 사이트는 먼저 로그인해야 합니다’에 체크하면 ‘항상’으로 설정됩니다.

파서 고치기

NeoDownloader 창의 프로젝트 ‘속성’ 탭에는 ‘파서 고치기’를 제안하는 카드가 있습니다. ‘파서 고치기’는 프로젝트의 마지막 실행을 레시피 편집기로 열어, 더는 아무것도 찾지 못하게 된 단계에서 보여 줍니다. 편집기는 실험적인 기능입니다. 편집기가 열리기 전에 NeoDownloader는 ‘레시피 편집기는 아직 미완성입니다’라고 경고하며, 편집기가 실행을 고치지 못할 수도 있다고 알립니다.