Apache Spark MLlib 기초 데이터 구조 및 활용법

로컬 벡터 (Local Vectors) MLlib에서 사용하는 로컬 벡터는 크게 조밀 벡터(Dense Vector)와 희소 벡터(Sparse Vector)로 구분됩니다. 조밀 벡터는 모든 요소를 명시적으로 저장하는 반면, 희소 벡터는 0이 아닌 요소의 인덱스와 값만 저장하여 메모리 효율을 높입니다. 다음은 두 가지 벡터를 생성하는 예시입니다. import org.apache.spark.mllib.linalg.{Vector, Vect ...

7월 20일 05:17에 게시됨

Spark MLlib을 활용한 기초 통계 및 데이터 분석

1. 요약 통계 (Summary Statistics) Spark MLlib은 RDD[Vector] 형태의 데이터에 대해 열 단위의 요약 통계 기능을 제공합니다. 이를 위해 Statistics 클래스의 colStats 메서드를 사용하며, 이 메서드는 각 컬럼의 최대값, 최소값, 평균, 분산 등을 포함하는 MultivariateStatisticalSummary 객체를 반환합니다. import org.apache.spark.mllib.linalg.Vector import org ...

7월 11일 22:37에 게시됨

Apache Spark에서 RDD, DataFrame, Dataset 변환 방법

DataFrame와 RDD 상호작용 공식 문서: https://spark.apache.org/docs/2.2.1/sql-programming-guide.html 1. DataFrame와 RDD 상호작용 - 반사 방법 (RDD ⇒ DataFrame) ① 샘플 클래스 생성, ② toDF() 메소드 호출 package com.spark.example import org.apache.spark.sql.SparkSession /** * DataFrame과 RDD의 상호작용 예제 */ object SparkDataConversion { def main(ar ...

5월 23일 05:21에 게시됨