Hadoop 환경에서 HBase 분산 설정 가이드
사전 준비: Hadoop 클러스터 실행
HBase를 구동하기 전에 Hadoop이 정상적으로 작동 중인지 확인합니다.
$ start-dfs.sh
$ start-yarn.sh
HBase 버전 호환성 확인
Hadoop과 HBase 간 버전 호환성은 매우 중요합니다. 현재 Hadoop 버전을 먼저 확인하세요.
$ hadoop version
확인한 버전에 맞는 HBase를 Tsinghua 미러에서 다운로드합니다. 안정적인 릴리즈를 권장합니다.
...
9월 16일 00:34에 게시됨
HBase Shell 명령어 완벽 가이드
HBase는 Hadoop 파일시스템을 기반으로 데이터를 저장하는 분산 컬럼 기반 데이터베이스입니다. 구조적으로 하나의 마스터 서버와 여러 리전 서버로 구성되어 있으며, 데이터는 테이블(리전) 형식으로 저장됩니다. 이 가이드에서는 HBase Shell에서 사용하는 주요 명령어들을 상세히 설명하겠습니다.
HBase 아키텍처 개요
HBase는 마스터 서버가 전체 리전 서버들을 관리하 ...
8월 4일 11:06에 게시됨
Ubuntu Kylin 기반 Apache Hive 데이터 웨어하우스 구축 가이드
Apache Hive 개요
Apache Hive는 Hadoop 기반의 데이터 웨어하우스 인프라로, 구조화된 데이터 파일을 테이블 형태로 관리하고 SQL과 유사한 쿼리 언어인 HQL(Hive Query Language)을 통해 데이터를 조회할 수 있게 해줍니다. 내부적으로 HQL은 MapReduce 작업으로 변환되어 Hadoop 클러스터에서 실행됩니다.
Hive의 주요 특징
장점: SQL 익숙한 사용자라면 러닝 커 ...
8월 4일 02:48에 게시됨
YARN Capacity Scheduler와 노드 레이블 설정
Hadoop YARN(Yet Another Resource Negotiator) 클러스터에서 자원 활용 효율성을 극대화하기 위해 노드 레이블(Node Labels) 기능은 특정 유형의 워크로드를 특정 노드 그룹에 할당하는 강력한 메커니즘을 제공합니다. 이는 이종(heterogeneous) 클러스터 환경에서 특히 유용하며, Capacity Scheduler와 함께 구성될 때 더욱 정교한 자원 관리가 가능해집니다.
YARN Capa ...
7월 27일 06:56에 게시됨
CDH 5.14.0 환경에서 Spark 및 Kafka 통합 설치 가이드
환경 준비
운영체제: CentOS 7
CDH 버전: 5.14.0
사전 설치 필요 항목:
MySQL 서버
OpenJDK 또는 Oracle JDK
모든 노드에 다음 패키지 설치:
yum -y install chkconfig python bind-utils psmisc libxslt zlib sqlite cyrus-sasl-plain cyrus-sasl-gssapi fuse portmap fuse-libs redhat-lsb
필수 파일 다운로드 (오프라인 배포용)
Cloudera Manager 5
파 ...
7월 26일 19:33에 게시됨
Flink YARN 배포 실전 가이드
대규모 클러스터 환경에서 리소스를 효율적으로 활용하기 위해 Flink를 YARN 위에 배포하는 경우가 많습니다. 이 글에서는 Flink를 YARN에 구축하고 작업을 제출하는 전체 과정을 살펴봅니다.
사전 준비사항
HDFS와 YARN 서비스가 정상적으로 기동된 상태여야 합니다. 또한 Flink가 YARN과 상호작용하려면 Hadoop 설정 경로를 시스템에 알려주어야 합니다.
메모리 검사 ...
7월 26일 09:07에 게시됨
Impala를 이용한 데이터 웨어하우징 및 Flink 실시간 스트림 처리 연동
이 문서에서는 대규모 데이터 분석을 위해 Apache Impala를 활용하여 SQL 기반 데이터 웨어하우징 작업을 수행하는 방법과, Apache Flink를 사용하여 Apache Kafka와 연동하여 실시간 스트림 데이터를 처리하는 애플리케이션을 개발하는 과정을 다룹니다.
빅데이터 클러스터 환경 구성
Impala와 Flink를 사용하기 위해서는 Hadoop, Impala, Kafka, Flink, Zookeeper, Rang ...
7월 19일 22:10에 게시됨
Hadoop 고가용성 클러스터 구성
HDFS 고가용성 아키텍처
QJM(Quorum Journal Manager)
1. QJM은 Hadoop 공식 HA 솔루션으로 분산 저널링 시스템
2. Zookeeper 기반 ZKFC를 통한 Active/Standby 전환
3. Journal Node 클러스터에서 edits log 공유 및 동기화
ZKFailoverController 장애 전환
ZKFC의 주요 기능:
1. NameNode 상태 모니터링
2. Zookeeper와의 지속적 연결 유지
3. 선출 메커니즘: ...
7월 18일 21:10에 게시됨
HDFS CLI 명령어 실전 활용 가이드
HDFS(Hadoop Distributed File System)는 대용량 데이터를 분산 저장하고 처리하는 핵심 인프라입니다. 본 문서에서는 실무에서 자주 사용하는 HDFS 셸 명령어를 정리합니다.
디렉터리 탐색
파일 시스템 구조를 확인하는 기본 명령어입니다.
# 루트 디렉터리 목록 조회
hdfs dfs -ls /
# 하위 디렉터리까지 재귀적으로 조회
hdfs dfs -ls -R /
디렉터리 생성
계층 구조 ...
7월 12일 17:33에 게시됨
Hadoop 클러스터 환경 구축 - 이중 NameNode 구성
Hadoop 환경설정 파일 수정
필요한 설정 파일은 $HADOOP_HOME/etc/hadoop 디렉토리에 있으며, 다음과 같이 수정해야 한다.
core-site.xml
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://cluster</value>
</property>
<property>
<name>hadoop.tmp.dir</name>
< ...
7월 8일 06:03에 게시됨