Kudu의 파티셔닝 방법
확장성을 제공하기 위해 Kudu 테이블은 여러 태블릿 서버에 분산된 태블릿 단위로 나뉩니다. 각 행은 항상 특정 태블릿에 속하며, 이는 테이블 생성 시 설정된 파티셔닝 규칙에 따라 결정됩니다. Kudu는 다음 3가지 방식으로 데이터를 파티셔닝할 수 있습니다:
범위 파티셔닝 (Range Partitioning)
범위 파티셔닝은 데이터량에 따라 균형있게 기계 간에 분배하여 부하 불균 ...
7월 2일 04:40에 게시됨
Spark에서 Kudu DML 작업 처리하기
Kudu는 다양한 DML 유형의 작업을 지원하며, 이러한 작업 중 일부는 Spark on Kudu 통합에서 사용할 수 있습니다.
포함되는 작업:
INSERT - DataFrame의 행을 Kudu 테이블에 삽입합니다. INSERT는 API에서 완전히 지원되지만 Spark에서는 사용을 권장하지 않습니다. Spark 태스크가 재실행될 가능성이 있어 이미 삽입된 행을 다시 삽입해야 할 수 있으므로 위험합니다. 이 ...
6월 24일 23:24에 게시됨
Apache Kudu 1.6.0 CDH5.14.0 분산 클러스터 구축 가이드
Kudu 아키텍처 개요
Kudu는 컬럼 기반 분산 스토리지로, Raft 합의 알고리즘을 기반으로 리더-팔로워 구조를 유지합니다. 마스터 노드와 태블릿 서버 간의 역할 분담을 통해 고가용성을 확보하며, 특정 태블릿에 대해 리더 역할을 수행하는 서버가 다른 태블릿에 대해서는 팔로워로 동작할 수 있습니다.
핵심 구성 요소
Table: 스키마와 정렬된 기본 키를 가진 데이터 ...
6월 6일 18:50에 게시됨
Kudu 쓰기 데이터 처리 흐름 분석
쓰기 작업은 삽입, 업데이트 또는 삭제를 수행해야 하는 행 그룹을 의미합니다. Kudu는 기본 키의 고유성을 강제하며, 기본 키는 행을 식별할 수 있는 유일한 식별자입니다. 이 제약 조건을 강제하기 위해 Kudu는 삽입과 업데이트 작업을 다르게 처리해야 하며, 이는 Tablet 서버가 쓰기 작업을 처리하는 방식에 영향을 미칩니다.
Kudu의 각 Tablet은 사전 쓰기 로그(WAL) ...
6월 5일 00:25에 게시됨