Python 웹 크롤러 기초: HTTP 요청과 응답 처리

웹 크롤러의 종류 범용 크롤러는 검색 엔진처럼 모든 웹사이트를 무차별적으로 수집하여 키워드를 추출하고 인덱스를 생성한다. 반면 특화(포커스) 크롤러는 특정 도메인에 한정된 데이터만 수집하도록 설계된다. Robots 프로토콜 robots.txt 파일은 크롤러가 접근 가능한 경로를 명시하는 규약이다. 예: taobao.com/robots.txt. 이는 법적 구속력 없이 자율적으로 따르는 ...

9월 13일 05:53에 게시됨

크롤링 관련 실용적인 팁 및 기술

크롤링 관련 실용적인 팁 및 기술 목차- 크롤링 관련 실용적인 팁 PyCharm을 활용한 문자열 처리 (예: 요청 헤더에 따옴표 추가) Chrome F12 디버거에서 "Debugger Paused" 해결 방법 수동으로 프록시 설정 변경하기 User-Agent 풀 구성 및 활용 프로그램 실행 시간 표시 중요한 크롤링 요청 파라미터 구성 문자열 날짜에 하루 더하기 스레드 풀과 고정 간격의 ...

7월 4일 21:01에 게시됨