Apache Kafka 고성능 비결 및 면접 대비

Apache Kafka의 성능을 극대화하는 기술적 원리와 면접에서 자주 등장하는 핵심 질문들을 다룹니다. 1. Kafka는 왜 빠른가? (필수 질문!) 핵심 기술: 순차 디스크 I/O: 로그 파일에 데이터를 순차적으로 추가하여 디스크 헤드의 무작위 탐색을 최소화합니다. 이는 테이프에 데이터를 쓰는 것과 유사한 방식입니다. Zero-Copy 기술: sendfile 시스템 호출을 사 ...

9월 8일 12:48에 게시됨

SeaTunnel Web 로컬 설치: 아키텍처 이해와 운영 최적화 전략

1. 시스템 구성 요소와 통신 구조 분석 SeaTunnel Web은 Apache SeaTunnel 프로젝트의 중앙 제어 인터페이스로, 다중 계층의 분산 아키텍처를 기반으로 동작한다. 핵심 구성 요소는 다음과 같다: 데이터 처리 엔진(Zeta): 실시간 데이터 파이프라인 실행 및 작업 스케줄링 담당 백엔드 서비스: 사용자 요청을 처리하고 엔진과 상태를 동기화하는 API 서버 프론트엔 ...

8월 30일 21:13에 게시됨

Kafka Connect API를 활용한 데이터 파이프라인 구축

Kafka Connect는 Kafka를 다양한 외부 데이터 소스 및 싱크와 통합하여 데이터 파이프라인을 구축하는 강력한 프레임워크입니다. 주로 데이터의 시작점 또는 끝점으로 사용되거나, Kafka를 데이터 전송의 중간 버퍼로 활용하는 시나리오에 적용됩니다. Kafka Connect는 크게 두 가지 유형의 커넥터로 나뉩니다: Source 커넥터: 외부 시스템의 데이터를 Kafka 토픽으 ...

8월 24일 08:48에 게시됨

Apache Kafka 시작 가이드: 설치부터 분산 클러스터 운영까지

Apache Kafka 환경 설정 및 단일 노드 실행 Apache Kafka는 고성능 분산 스트리밍 플랫폼으로, 실시간 데이터 처리 파이프라인 및 스트리밍 애플리케이션 구축에 널리 사용됩니다. Kafka를 사용하기 위해서는 먼저 ZooKeeper가 필요합니다. 본 가이드에서는 Kafka와 함께 제공되는 ZooKeeper 스크립트를 사용하여 단일 인스턴스를 시작하고, 이후 여러 Kafka 브로커로 구성 ...

8월 2일 18:04에 게시됨

CDH 5.14.0 환경에서 Spark 및 Kafka 통합 설치 가이드

환경 준비 운영체제: CentOS 7 CDH 버전: 5.14.0 사전 설치 필요 항목: MySQL 서버 OpenJDK 또는 Oracle JDK 모든 노드에 다음 패키지 설치: yum -y install chkconfig python bind-utils psmisc libxslt zlib sqlite cyrus-sasl-plain cyrus-sasl-gssapi fuse portmap fuse-libs redhat-lsb 필수 파일 다운로드 (오프라인 배포용) Cloudera Manager 5 파 ...

7월 26일 19:33에 게시됨

스프링 부트에서의 로컬 및 분산 로그 시스템 구성

최근 면접 과정에서 로그 관리에 대한 질문을 자주 접했고, 이에 대해 로컬 로그 출력과 전방위 분산 로깅 시스템 구성을 정리해본다. 목적은 프레임워크 내부에서 사용하는 로컬 로깅 시스템과 분산 트레이싱 기능을 소개하는 것이다. 로컬 로그는 스프링이 권장하는 Logback을 기반으로 하며, 기본적으로 최소한의 설정만으로 동작한다. 분산 로그 추적(전방 ...

7월 17일 23:51에 게시됨

Snuba 아키텍처 분석: Sentry의 실시간 데이터 처리 엔진

Snuba는 ClickHouse 기반의 분산 데이터 플랫폼으로, Kafka에서 직접 데이터를 수집하고 최적화된 쿼리를 제공하는 서비스입니다. Sentry의 에러 추적 및 성능 모니터링 기능을 지원하는 핵심 인프라입니다. 핵심 역할 Snuba는 기존 Postgres와 Redis 조합을 대체하여 설계되었으며, 현재는 Sentry의 대부분의 시계열 기능을 담당하고 있습니다. 주요 기능 ClickHouse ...

7월 17일 16:42에 게시됨

CentOS에서 Kafka 중앙 메시지 브로커 설치 및 설정

환경 구성 및 사전 준비 운영체제: CentOS Linux 7.6.1810 (Core) Kafka 버전: kafka_2.12-2.2.0 JDK 버전: 1.8.0_212 이상 설치 단계 1. 패키지 다운로드 Apache 공식 저장소에서 Kafka 압축 파일을 다운로드합니다. curl -O https://archive.apache.org/dist/kafka/2.2.0/kafka_2.12-2.2.0.tgz 접속이 불가할 경우 다른 미러를 사용하세요. wget http://mirrors.tu ...

7월 14일 17:50에 게시됨

카프카 모니터링 종합 가이드: 최상의 카프카 대시보드 및 모니터링 설정과 경고 규칙

다중 카프카 모니터링을 위한 kafka_exporter 활용 kafka_exporter 프로젝트 주소: https://github.com/danielqsj/kafka_exporter docker-compose를 사용하여 여러 kafka_exporter를 배포하며, 각 exporter는 하나의 카프카 클러스터와 연동됩니다. 주의사항: 각 카프카 브로커 주소를 구성하며, kafka3는 버전을 명시해야 합니다. version: '3.8' services: monitor ...

7월 10일 02:35에 게시됨

Rust 기반 Sentry Relay 개발 및 디버깅 환경 설정 가이드

개발 환경 구성 Sentry Relay는 최신 안정 버전의 Rust로 빌드되며, 워크스페이스 내 다수의 크레이트(crate)로 분리되어 있습니다. 따라서 빌드나 테스트 시 --all 및 --all-features 플래그를 함께 사용하는 것이 중요합니다. 특히 processing 기능을 활성화하려면 C 컴파일러와 CMake도 필요합니다. 빌드 전 librdkafka 라이브러리가 시스템 경로에 설치되어 있어야 합 ...

7월 9일 22:46에 게시됨