Flink YARN 배포 실전 가이드

대규모 클러스터 환경에서 리소스를 효율적으로 활용하기 위해 Flink를 YARN 위에 배포하는 경우가 많습니다. 이 글에서는 Flink를 YARN에 구축하고 작업을 제출하는 전체 과정을 살펴봅니다. 사전 준비사항 HDFS와 YARN 서비스가 정상적으로 기동된 상태여야 합니다. 또한 Flink가 YARN과 상호작용하려면 Hadoop 설정 경로를 시스템에 알려주어야 합니다. 메모리 검사 ...

7월 26일 09:07에 게시됨

HDFS CLI 명령어 실전 활용 가이드

HDFS(Hadoop Distributed File System)는 대용량 데이터를 분산 저장하고 처리하는 핵심 인프라입니다. 본 문서에서는 실무에서 자주 사용하는 HDFS 셸 명령어를 정리합니다. 디렉터리 탐색 파일 시스템 구조를 확인하는 기본 명령어입니다. # 루트 디렉터리 목록 조회 hdfs dfs -ls / # 하위 디렉터리까지 재귀적으로 조회 hdfs dfs -ls -R / 디렉터리 생성 계층 구조 ...

7월 12일 17:33에 게시됨

CentOS 7 환경에서 CDH를 활용한 Hadoop 클러스터 구축 가이드

1. 사전 준비 및 역할 할당 리소스 다운로드: 링크: 네이버 클라우드 1.1. 서버 및 역할 계획 다음과 같이 3대의 서버를 준비하고 역할을 분담합니다: hadoop01 (192.168.1.136): CM Server, NameNode, ResourceManager hadoop02 (192.168.1.137): DataNode, NodeManager hadoop03 (192.168.1.138): DataNode, NodeManager 1.2. 방화벽 및 SELinux 비활성화 모든 노드 ...

6월 27일 22:44에 게시됨

HDFS NameNode 안전 모드 이해와 운영

안전 모드 동작 원리 분석 1.1 서비스 개별 시작을 통한 현상 재현 모든 Hadoop 서비스를 중지한 후, 각 프로세스를 수동으로 실행하며 안전 모드의 동작을 확인할 수 있다. stop-all.sh jps hdfs --daemon start namenode jps NameNode만 실행된 상태에서 파일 시스템 조회는 가능하지만, 데이터 조작 작업은 제한된다. hadoop fs -ls / # 정상적으로 디렉 ...

6월 25일 21:46에 게시됨

Flume의 핵심 개념 및 활용 사례

Flume 아키텍처 Flume는 대규모 로그 데이터 수집, 집계 및 전송을 위한 분산형, 신뢰성 있는, 고가용성 시스템입니다. 다양한 데이터 소스에서 데이터를 수집하고, 처리 후 목적지로 전송하는 기능을 제공합니다. 이 시스템에서는 데이터 흐름을 '이벤트(Event)'라는 단위로 관리하며, 이벤트는 바이트 배열 형태의 데이터와 헤더 정보를 포함합니다. 이벤트(Event)란? ...

5월 30일 02:31에 게시됨

HDFS 성능 최적화 기법

단락 읽기(Short Circuit Local Reads) 최적화 개요 HDFS의 기본 읽기 방식은 DFSClient가 데이터 노드에 위치한지 여부와 관계없이 동일하게 동작합니다. 데이터 노드가 디스크에서 블록을 읽은 후 TCP 기반 RPC를 통해 DFSClient에 전달하는 구조입니다. 이 방식은 구현이 단순하지만, 동일 노드에 클라이언트와 데이터가 존재할 경우 불필요한 중간 단계로 인해 지연이 ...

5월 29일 22:16에 게시됨

Hive에서 소규모 파일 과다 문제 해결方案

소규모 파일이 야기하는 문제점 HDFS에서 소규모 파일이过多하게 되면 다음과 같은 문제가 발생할 수 있습니다: 네임노드 메모리 부하: HDFS 파일은 데이터 블록과 메타정보(위치, 크기, 분할 정보 등)를 포함합니다. 이 메타정보는 네임노드 메모리에 저장되며, 각 객체당 약 150바이트를 차지합니다. 천만 개의 파일과 블록이 있으면 약 3GB의 메모리를 사용하게 되어 ...

5월 25일 22:34에 게시됨