Selenium을 활용한 동적 웹 스크래핑 기술
동적 콘텐츠 수집을 위한 Selenium 활용법
Selenium은 주로 자동화 테스트에 사용되지만, JavaScript 기반으로 동적으로 렌더링되는 웹페이지를 크롤링할 때 매우 유용한 도구입니다. 이 방식은 화면에 실제로 표시되는 내용을 그대로 추출할 수 있어, 정적인 HTML 파싱만으로는 접근하기 어려운 사이트에서도 데이터를 효과적으로 수집할 수 있습니다.
사전 준비
Chrome ...
8월 6일 21:06에 게시됨
파이썬 웹 스크레이핑: 하루 만에 수백만 건 데이터 수집하기
데이터 분석, 시장 동향 파악, 특정 분야의 발전 양상 이해 등 다양한 목적으로 대량의 데이터를 수집해야 할 때가 있습니다. 수동으로 데이터를 모으는 것은 시간이 많이 들고 비효율적이며, 데이터의 정확성과 완전성을 보장하기 어렵습니다. 이러한 대규모 데이터 수집 작업을 빠르고 효율적으로 수행할 수 있는 방법은 없을까요?
파이썬은 풍부한 서드파티 라이브러리 ...
7월 25일 04:23에 게시됨
Python을 이용한 웹 스크래핑 기초
이 섹션에서는 Python으로 웹 페이지를 쉽게 스크래핑할 수 있도록 도와주는 여러 모듈을 살펴봅니다.
webbrowser: Python 표준 라이브러리의 일부로, 지정된 웹 페이지를 열기 위해 브라우저를 실행합니다.
requests: 인터넷에서 파일과 웹 페이지를 다운로드하는 데 사용됩니다.
Beautiful Soup: 웹 페이지를 작성하는 데 사용되는 HTML을 파싱하는 데 특화 ...
7월 22일 11:55에 게시됨
Douyin 영상 자동 수집 및 관리 시스템 구축 가이드
배경: 콘텐츠 수집의 비효율성
숏폼 콘텐츠가 폭발적으로 증가하는 현재, 특정 플랫폼의 영상을 체계적으로 보관하고 활용하는 것은 개인 사용자부터 연구자까지 폭넓은 니즈를 가진 과제입니다. 수동으로 영상을 저장하는 방식은 시간 소모가 크고, 메타데이터 손실, 중복 저장, 파일 관리 혼란 등의 문제를 야기합니다.
이 글에서는 Python 기반 오픈소스 도구를 활용 ...
7월 21일 16:02에 게시됨
Python 기반 웹 스크래핑: JS 역분석과 WOFF 폰트 파싱으로 영화 평점 데이터 수집하기
개요
특정 영화 정보 플랫폼의 평점 데이터는 다층적인 보안 메커니즘으로 보호되어 있다. 본 문서에서는 JavaScript 역분석을 통한 요청 파라미터 복원과 WOFF(Web Open Font Format) 폰트 치환 기법을 활용해 실제 수치를 추출하는 방법을 다룬다.
전체 흐름
데이터 수집은 다음 단계로 진행된다:
동적 페이지 내 삽입된 API 엔드포인트 식별
JS 난독화 로직 분석 ...
7월 14일 04:03에 게시됨
빠르게 시작하는 도우인 콘텐츠 수집 시스템: 고해상도 무수정 다운로드 플랫폼 구축
3분 내 완성! 도우인(Доуин) 콘텐츠 자동 수집 플랫폼 세팅 가이드
현대의 디지털 콘텐츠 제작자라면, 흔히 빠진 작업 중 하나가 바로 소스 영상과 이미지의 효율적 확보입니다. 수동으로 저장하거나 스크린샷을 찍는 방식은 시간 낭비에다 품질 저하까지 초래합니다. 이번 글에서는 오픈소스 기반의 도우인 다운로더를 활용해, 단 3분 만에 고화질 무수정 콘텐츠 수집 시 ...
6월 25일 23:52에 게시됨
Python을 활용한 자동 인식 캡차 처리 시스템 구현
웹사이트의 보안 캡차를 자동으로 인식하고 입력하는 기능은 웹 스크래핑과 이미지 분석 기술을 결합하여 구현할 수 있습니다. 아래는 파이썬 기반의 종합적인 해결 방안입니다.
1. 캡차 이미지 다운로드
목표 페이지에서 캡차 이미지의 링크를 추출한 후, requests 라이브러리를 사용해 로컬에 저장합니다.
import requests
def fetch_captcha_image(i ...
6월 23일 23:53에 게시됨
복잡한 크롤링 방지 메커니즘 대응 전략: Scrapy와 Playwright의 협업 방법
1장: 동적 웹 콘텐츠 처리를 위한 분산 크롤링 시스템 설계 (Scrapy + Playwright)
현대 웹사이트의 동적 렌더링이 증가함에 따라 기존 정적 요청 기반 크롤링 프레임워크는 한계를 보이고 있습니다. Scrapy의 효율적인 스케줄링 기능과 Playwright의 브라우저 자동화 기술을 결합하여, 고내성의 분산 크롤링 시스템을 구축할 수 있습니다.
환경 구성 및 의존성 통합
프 ...
6월 16일 19:59에 게시됨
Python 기반 동기 웹 크롤링: XPath를 활용한 데이터 추출
동기 로딩 페이지의 특징
브라우저에서 렌더링된 콘텐츠와 서버 응답 본문, 또는 우클릭으로 확인하는 소스 코드가 완전히 일치합니다. 이는 클라이언트 측 스크립트 없이 정적 콘텐츠로 구성된 페이지임을 의미합니다.
기본 요청 구조
import requests
from lxml import etree
target_url = 'https://www.shu.com/bookmark/sidamingzhu.html'
request_headers = {
' ...
6월 10일 17:56에 게시됨
Python을 활용한 웹 스크래핑 및 자동화 인증
이미지 다운로드 유틸리티 구현
웹 리소스를 로컬에 저장하는 기본적인 기능부터 시작합니다. requests 라이브러리를 활용하여 원격 이미지를 효율적으로 다운로드하는 방법을 살펴봅니다.
import requests
def fetch_remote_image(target_url, destination_path):
"""원격 이미지를 지정된 경로에 저장"""
server_response = requests.get(url=target_url)
w ...
5월 21일 22:46에 게시됨