HBase RowKey 필터링 실패 원인과 해결 방안
HBase 테이블에 총 746건의 데이터가 존재하는 상황에서, Spark으로 처리하기 어려운 알고리즘을 Java로 직접 구현하여 HBase를 조회해야 했다. 성능 향상을 위해 필터를 적극 활용했으나, 예상치 못한 데이터 누락 문제가 발생했다.
초기 RowKey 설계 및 문제 발생
처음에는 시간_주문ID 형태로 RowKey를 구성했다.
RowKey 구조: yyyyMMddHHmm_주문식별자
예시: 201904 ...
6월 1일 16:30에 게시됨
Flume의 핵심 개념 및 활용 사례
Flume 아키텍처
Flume는 대규모 로그 데이터 수집, 집계 및 전송을 위한 분산형, 신뢰성 있는, 고가용성 시스템입니다. 다양한 데이터 소스에서 데이터를 수집하고, 처리 후 목적지로 전송하는 기능을 제공합니다. 이 시스템에서는 데이터 흐름을 '이벤트(Event)'라는 단위로 관리하며, 이벤트는 바이트 배열 형태의 데이터와 헤더 정보를 포함합니다.
이벤트(Event)란? ...
5월 30일 02:31에 게시됨
노터시의 차량 집중 영역 분석
유버와 유사한 플랫폼에서 시간대별 지역별 주문 밀집도를 파악해 차량 배차 최적화를 수행해야 함
각 주문 데이터(Order)에는 출발지 위도(open_lat), 경도(open_lng) 정보가 포함됨
특정 시간대에 어떤 지역이 주문 요청이 높은지 파악해 시각화된 히트맵을 생성해야 함
초기 구현 시 위도 경도 기반 클러스터링을 고려함. 대표적인 클러스터링 알고리즘인 K-평균 알고리 ...
5월 26일 18:37에 게시됨