Python을 이용한 데이터 수집 및 처리 과제
본 문서는 Python 프로그래밍 언어를 활용하여 웹 스크래핑, 데이터 처리 및 데이터베이스 저장 기법을 다루는 세 가지 과제에 대한 내용을 담고 있습니다. 각 과제는 실제 데이터를 다루는 과정을 통해 데이터 엔지니어링의 핵심 기술을 습득하는 데 중점을 둡니다.
과제 1: 지역별 날씨 예보 데이터 수집 및 저장
요구사항: 중국 기상망(http://www.weather.com ...
9월 29일 20:15에 게시됨
웹 스크래핑 기초: 서브페이지에서 데이터 추출하는 방법
서브페이지 데이터 스크래핑 프로세스
웹 스크래핑 작업을 수행할 때, 단일 페이지에서 모든 필요한 데이터를 얻을 수 없는 경우가 많습니다. 이러한 상황에서는 메인 페이지에서 서브페이지의 URL을 추출한 후, 각 서브페이지에 개별적으로 요청을 보내 원하는 데이터를 수집해야 합니다. 본 글에서는 Python의 requests 라이브러리와 정규식을 활용하여 서브페이지에서 ...
9월 8일 07:27에 게시됨
파이썬 웹 스크래핑 초보자 가이드
파이썬 웹 스크래핑 입문 가이드
웹 스크래핑이란
웹 스크래핑은 웹사이트의 콘텐츠를 프로그래밍 방식으로 수집하는 기술입니다. 이 과정에서 우리는 웹 페이지의 구조와 데이터를 추출하는 방법을 학습하게 됩니다.
웹 페이지의 구조
우리가 보는 웹 페이지는 주로 HTML이라는 마크업 언어로 작성됩니다. HTML은 텍스트에 다양한 스타일과 구조를 적용할 수 있게 해줍니 ...
8월 20일 17:44에 게시됨
Python requests를 사용한 HTTP 요청 처리: GET, POST 및 인코딩 관리
requests 라이브러리를 활용한 웹 요청 기본
Python에서 웹 서버와 통신할 때 requests 모듈은 가장 널리 사용되는 도구 중 하나다. 이 라이브러리는 HTTP GET 및 POST 요청을 간편하게 보내고 응답을 처리할 수 있도록 설계되어 있으며, 웹 스크래핑이나 API 연동 작업에 매우 유용하다.
GET 요청의 두 가지 방식
GET 요청은 주로 서버로부터 데이터를 조회할 때 사용되 ...
8월 15일 10:31에 게시됨
Python 정규식 실무 완벽한 가이드: 데이터 추출부터 자동화까지
정규식 메타문자 이해하기
파이썬의 re 모듈을 활용한 패턴 매칭은 텍스트 처리의 핵심입니다. 일반적인 문자열 대입과는 달리 특수 문자를 사용하여 구조화된 정보를 찾아내야 합니다.
일반 문자: 지정한 대로만 일치합니다.
\d: 숫자 0 에서 9 까지의 값을 매칭합니다.
.: 줄바꿈을 제외한 임의의 한 문자를 의미하며, 멀티라인 처리 시 re.S 옵션을 추가해야 합니다.
. ...
8월 14일 12:03에 게시됨
Python 웹 크롤러에서 쿠키 및 세션 관리 기법
수동으로 쿠키 추가하기
일부 웹사이트는 동적 콘텐츠를 로드하기 때문에, 단순한 GET 요청만으로는 데이터를 가져올 수 없습니다. 이 경우 브라우저에서 세션 정보를 유지하기 위해 사용되는 Cookie 값을 직접 헤더에 포함시켜 요청을 보내야 합니다.
예를 들어, https://xq.com/ 사이트에 접근하면 서버는 클라이언트에 고유한 쿠키를 할당합니다. 개발자 도구의 "Networ ...
7월 29일 19:23에 게시됨
Python API 테스트 실습 - Python으로 HTTP 요청 보내기
학습 내용
requests 라이브러리 설치
requests 사용법
JSON 타입 처리
requests 라이브러리 심층 분석
보안 인증이 필요한 요청 처리
서론
이전 시간에 API 테스트의 기초 이론과 패킷 캡처 도구, Postman을 활용한 수동 테스트 방법을 학습했습니다. 이제 Python 언어를 사용하여 API 요청을 자동으로 보내는 방법을 학습하겠습니다.
Python에서 HTTP 요청을 보내기 ...
7월 27일 03:52에 게시됨
파이썬 웹 스크레이핑: 하루 만에 수백만 건 데이터 수집하기
데이터 분석, 시장 동향 파악, 특정 분야의 발전 양상 이해 등 다양한 목적으로 대량의 데이터를 수집해야 할 때가 있습니다. 수동으로 데이터를 모으는 것은 시간이 많이 들고 비효율적이며, 데이터의 정확성과 완전성을 보장하기 어렵습니다. 이러한 대규모 데이터 수집 작업을 빠르고 효율적으로 수행할 수 있는 방법은 없을까요?
파이썬은 풍부한 서드파티 라이브러리 ...
7월 25일 04:23에 게시됨
Python을 이용한 웹 스크래핑 기초
이 섹션에서는 Python으로 웹 페이지를 쉽게 스크래핑할 수 있도록 도와주는 여러 모듈을 살펴봅니다.
webbrowser: Python 표준 라이브러리의 일부로, 지정된 웹 페이지를 열기 위해 브라우저를 실행합니다.
requests: 인터넷에서 파일과 웹 페이지를 다운로드하는 데 사용됩니다.
Beautiful Soup: 웹 페이지를 작성하는 데 사용되는 HTML을 파싱하는 데 특화 ...
7월 22일 11:55에 게시됨
간단한 30줄 코드로 HTTP 테스트 프레임워크 구현하기
이 프레임워크는 도메인 특화 언어와 템플릿 해석을 기반으로 동작합니다. 먼저, 수행할 작업을 명확히 정의하는 형식을 제정하고, 이를 통해 사용자 정의 문법을 실제 코드로 변환하여 실행합니다. 예를 들어, 다음 YAML 파일은 여러 단계의 요청과 변수 연관성을 정의합니다.
apis.yaml:
- name: 백도스 토큰 획득
request:
url: https://aip.baidubce.com/oauth/2 ...
7월 20일 18:05에 게시됨