Spark RDD 변환 연산
inputFile = r'C:\Data\sample.txt'
rddData = sparkContext.textFile(inputFile)
rddData.flatMap(lambda x: x.split()).map(lambda x: (x, 1)).reduceByKey(lambda a, b: a+b)
2. RDD 생성
(1) 컬렉션 데이터에서 RDD 생성
numbers = [10, 20, 30, 40, 50]
baseRDD1 = sc.parallelize(numbers)
baseRDD2 = sc.parallelize(numbers, 3)
baseRDD2.count()
반복(Iteration ...
7월 6일 21:35에 게시됨
PySpark 기초 실습 및 RDD 활용
PySpark에서 Spark 작업 환경을 초기화하고 버전 정보를 확인하는 방법은 다음과 같습니다.
# 필요한 모듈 가져오기
from pyspark import SparkConf, SparkContext
# Spark 설정 객체 생성
config = SparkConf().setMaster("local[*]").setAppName("example_app")
# SparkContext 생성
context = SparkContext(conf=config)
# 현재 PySpark 버전 출력
print(context.ver ...
6월 6일 20:05에 게시됨