PySpark 기반 LDA 구현: 대규모 스트 주제 분석

대규모 사용자 리뷰 데이터에서 잠재적 주제를 추출하기 위해 PySpark와 LDA(Latent Dirichlet Allocation)를 결합한 파이프라인을 구축한다. 이 글에서는 분산 환경에서의 텍스트 전처리, 모델 훈련, 결과 해석 전 과정을 다룬다. SparkSession 초기화 YARN 클스터에 연결하고 Hive 메타스토어를 활용하는 세션을 생성한다. 원격 Python 환경 경로를 명시하여 노드 간 ...

10월 1일 22:03에 게시됨

엑셀 파일 읽기 및 쓰기: 지역별 학교 데이터 필터링 및 처리

import xlrd import xlwt # 엑셀 파일 읽기 함수 def load_excel_data(file_path): # 파일 열기 객체 생성 workbook = xlrd.open_workbook(file_path) worksheet = workbook.sheet_by_index(0) # 데이터 저장소 초기화 educational_institutions = [] # 모든 행 순회 for row_idx in range(worksheet.nrows): institutio ...

6월 26일 17:41에 게시됨

논문 중복 검사 시스템 구현

프로젝트 개요 이 프로젝트는 두 텍스트 문서 간의 유사도를 평가하여 중복률을 계산하는 논문 체크 시스템을 구현한 것입니다. 입력으로 원본 문서와 변형된 복제 문서를 받고, 결과를 소수점 둘째 자리까지 정밀하게 출력합니다. 기능 요구사항 명령줄 인자로 세 가지 경로를 입력받음: 원본 파일, 복제 파일, 출력 파일 텍스트는 UTF-8 인코딩으로 읽기 결과는 ...

6월 4일 19:02에 게시됨

파이썬 프로그래밍 시작하기: 기본 문부터 딥러닝 도구까지

파이썬 기초 학습 1. matplotlib를 활용한 시각화 matplotlib는 파이썬에서 가장 널리 사용되는 데이터 시각화 라이브러리입니다. 다양한 종류의图表를 생성할 수 있으며, 공식 샘플 갤러리에서 많은 예제를 확인할 수 있습니다. 2. 한글 폰트 설정 matplotlib에서 한글을 표시하려면 폰트 속성을 지정해야 합니다: import matplotlib.font_manager as fm import matplot ...

5월 22일 22:50에 게시됨