웹 스크래핑 기초: 서브페이지에서 데이터 추출하는 방법
서브페이지 데이터 스크래핑 프로세스
웹 스크래핑 작업을 수행할 때, 단일 페이지에서 모든 필요한 데이터를 얻을 수 없는 경우가 많습니다. 이러한 상황에서는 메인 페이지에서 서브페이지의 URL을 추출한 후, 각 서브페이지에 개별적으로 요청을 보내 원하는 데이터를 수집해야 합니다. 본 글에서는 Python의 requests 라이브러리와 정규식을 활용하여 서브페이지에서 ...
9월 8일 07:27에 게시됨
Python 정규식 실무 완벽한 가이드: 데이터 추출부터 자동화까지
정규식 메타문자 이해하기
파이썬의 re 모듈을 활용한 패턴 매칭은 텍스트 처리의 핵심입니다. 일반적인 문자열 대입과는 달리 특수 문자를 사용하여 구조화된 정보를 찾아내야 합니다.
일반 문자: 지정한 대로만 일치합니다.
\d: 숫자 0 에서 9 까지의 값을 매칭합니다.
.: 줄바꿈을 제외한 임의의 한 문자를 의미하며, 멀티라인 처리 시 re.S 옵션을 추가해야 합니다.
. ...
8월 14일 12:03에 게시됨
파이썬 철학 스크래핑 실습
요청:
https://localprod.pandateacher.com/python-manuscript/hello-spiderman/에서 'Python의 철학' 중영문 버전을 추출하여 출력하는 스크립트 작성
목표:
동적 웹 페이지 크롤링 기법 연습
Selenium과 BeautifulSoup의 통합 활용 연습
URL: https://localprod.pandateacher.com/python-manuscript/hello-spiderman/
방법 1: 순수 Selenium 사용
1 from selenium ...
6월 26일 00:57에 게시됨
DrissionPage 핵심 기능 실전 가이드
DrissionPage(이하 DP)는 Selenium의 번거로움을 해결하고자 설계된 웹 자동화 도구로, 브라우저 기반 스크레이핑과 순수 HTTP 요청을 모두 지원한다. 본문에서는 실무에 바로 적용할 수 있는 핵심 기능을 중심으로 살펴본다.
환경 구성 및 모듈 임포트
패키지 설치 후 주요 모듈은 다음과 같이 가져온다.
# 터미널에서 설치
# pip install DrissionPage
from DrissionPa ...
6월 19일 23:08에 게시됨