Spring Boot에서 Hive JDBC 연동 및 데이터 조회 구현
개요기존 데이터베이스로는 대용량 데이터 분석 시 성능 병목이 발생하는 경우가 많습니다. 이 글에서는 Spring Boot 환경에서 Hive 서버에 JDBC로 접속하여 데이터를 조회하고 처리하는 방법을 살펴봅니다. CDH(Cloudera Distribution Including Apache Hadoop) 환경을 기준으로 작성되었습니다.실행 환경구성 요소버전Spring Boot2.1.8.RELEASECDH5.15.1Hive1.1.0Hive 버 ...
7월 20일 02:11에 게시됨
Hive 파티션 테이블에 새 필드 추가 및 위치 지정
1. Hive 파티션 테이블 필드 추가
Hive 파티션 테이블에서 필드를 추가하고 특정 위치에 배치하려면 두 단계를 수행해야 합니다: 필드 추가와 필드 위치 변경
1) 필드 추가
ALTER TABLE 테이블이름 ADD COLUMNS (컬럼명 데이터타입 [COMMENT 컬럼코멘트], ...) [CASCADE|RESTRICT];
이 명령은 기존 컬럼 끝에但在分区列之前 새 컬럼을 추가할 수 있습니다
ADD COLUMN ...
7월 12일 23:40에 게시됨
Hive 내장 함수 종합 안내 (열 전환 및 집계 창 함수 포함)
Hive 함수 정리
본 문서는 Hive에서 사용 가능한 주요 내장 함수를 체계적으로 정리한 자료입니다. 수학, 조건, 문자열, 날짜, 집계, 행/열 변환, 그리고 창 함수 등 다양한 유형의 함수를 포함하며, 실제 쿼리 예제와 함께 설명됩니다.
기본 연산자
=: 동등 비교. 예: SELECT 1 WHERE 5 = 5;
<>: 불일치 비교. NULL 값이 포함되면 ...
6월 25일 01:08에 게시됨
Hive에서 발생하는 'Only SubQuery expressions that are top level conjuncts are allowed' 오류 해결
문제 상황
CDH 5.15.1 환경의 Hue 콘솔에서 Hive를 사용하여 복잡한 SQL을 실행할 때, IN 절 내부에 서브쿼리가 포함되어 있고, 그 조건이 OR와 함께 사용된 경우, 다음과 같은 오류가 발생합니다:
Only SubQuery expressions that are top level conjuncts are allowed
이 문제는 서브쿼리가 최상위 조건(즉, 논리식의 직접적인 구성 요소)이 아닌, 복합 조건 내부에 ...
6월 17일 20:13에 게시됨
Spark 버전 업그레이드: 1.6에서 2.4.6로의 이전 경험
저는 현재 작업 플랫폼 프로젝트에서 Spark 1.6.1 버전을 사용하고 있었으며, 주로 Python으로 개발했습니다.
현재 Spark 1.6.1 버전에서 2.4.6 버전으로 직접 업그레이드하는 작업을 진행했으며, 이 과정에서 여러 문제가 발생하여 이를 기록합니다:
문법 호환성 문제
데이터 플랫폼 작업은 일별 작업과 시간별 작업으로 나뉘며, 처리된 데이터를 Hive 테이블(분구)에 ...
5월 27일 17:30에 게시됨
Hive에서 소규모 파일 과다 문제 해결方案
소규모 파일이 야기하는 문제점
HDFS에서 소규모 파일이过多하게 되면 다음과 같은 문제가 발생할 수 있습니다:
네임노드 메모리 부하: HDFS 파일은 데이터 블록과 메타정보(위치, 크기, 분할 정보 등)를 포함합니다. 이 메타정보는 네임노드 메모리에 저장되며, 각 객체당 약 150바이트를 차지합니다. 천만 개의 파일과 블록이 있으면 약 3GB의 메모리를 사용하게 되어 ...
5월 25일 22:34에 게시됨