Pandas 그룹화 및 데이터 집계 기법
데이터 분석에서의 그룹화와 집계
데이터를 그룹으로 나누고 각 그룹에 대해 통계적 요약이나 변환 작업을 수행하는 것은 데이터 분석의 핵심 절차 중 하나입니다. Pandas는 groupby 메커니즘을 통해 이 과정을 직관적이고 효율적으로 지원합니다. 이를 통해 사용자는 데이터셋을 조각화하고, 그룹별로 평균, 합계, 표준편차 등의 지표를 산출하거나, 사용자 정의 함수를 ...
6월 25일 01:44에 게시됨
이미지 파일 이름 기반 자동 분류 및 처리 스크립트
1. 이미지 파일명에서 첫 번째 언더스코어 이전 부분 삭제
지정된 폴더 내 모든 이미지 파일의 이름에서 첫 번째 언더스코어와 그 앞의 내용을 제거하고, 나머지 부분으로 파일명을 변경합니다.
import os
def remove_prefix_underline(directory):
for filename in os.listdir(directory):
if filename.lower().endswith(('.png', '.jpg', '.jpeg', '.bmp', ...
6월 14일 20:15에 게시됨
파이썬 ExcelWriter 엔진 비교: xlsxwriter와 openpyxl의 성능 분석
파이썬으로 데이터를 처리할 때 최종 결과를 Excel로 내보내는 경우가 많습니다. 이때 pandas의 ExcelWriter는 필수 도구이지만, xlsxwriter와 openpyxl 엔진 중 어떤 것을 선택해야 할지 고민될 수 있습니다. 본 분석은 실제 성능 테스트와 기술적 특성을 비교하여 각 엔진의 적합한 사용 사례를 제시합니다.
1. 설계 철학 비교: 전문화 vs 범용성
두 엔진의 근본적인 ...
6월 7일 19:02에 게시됨
Pandas 핵심 기능 정리 (지속 업데이트)
DataFrame: 데이터 중심 구조
pandas의 핵심 데이터 구조인 DataFrame은 행과 열로 구성된 표 형태의 데이터를 다룹니다. 각 행은 인덱스로 식별되며, 열은 이름을 가집니다.
기본 모듈 로드
import pandas as pd
import numpy as np
데이터 생성 및 기본 조작
CSV 파일을 읽어와 DataFrame으로 변환하는 예시:
chicago_taxi_data = pd.read_csv("https://download.mlcc. ...
6월 2일 00:31에 게시됨
Python pdfplumber를 활용한 PDF 텍스트 및 테이블 데이터 정밀 추출 가이드
PDF 문서에서 데이터를 추출할 때 테이블 구조가 무너지거나 텍스트 단락이 뒤섞이는 문제를 자주 겪게 됩니다. PyPDF2나 pdfminer와 같은 기존 라이브러리는 복잡한 레이아웃, 특히 테이블 처리에 한계가 있어 데이터 분석이나 자동화 작업 시 효율이 떨어집니다. 이를 보완하기 위해 pdfplumber가 등장했습니다. 이 라이브러리는 PDF의 시각적 레이아웃을 정밀하게 복원 ...
6월 1일 21:08에 게시됨
판다스 계층적 데이터 요약 기법
지역 및 도시별 판매 데이터를 계층적으로 요약하는 방법을 소개합니다. 여러 단계의 중첩된 그룹화와 통계 계산을 통해 종합적인 보고서를 생성할 수 있습니다.
데이터 생성
import pandas as pd
import numpy as np
regions = ['North', 'East', 'South', 'Central']
products = ['TV', 'Refrigerator', 'Washer', 'AC']
city_mapping = {
'North': ['Seoul', 'In ...
5월 26일 11:29에 게시됨