Spark RDD 변환 연산

inputFile = r'C:\Data\sample.txt' rddData = sparkContext.textFile(inputFile) rddData.flatMap(lambda x: x.split()).map(lambda x: (x, 1)).reduceByKey(lambda a, b: a+b) 2. RDD 생성 (1) 컬렉션 데이터에서 RDD 생성 numbers = [10, 20, 30, 40, 50] baseRDD1 = sc.parallelize(numbers) baseRDD2 = sc.parallelize(numbers, 3) baseRDD2.count() 반복(Iteration ...

7월 6일 21:35에 게시됨

PySpark 기초 실습 및 RDD 활용

PySpark에서 Spark 작업 환경을 초기화하고 버전 정보를 확인하는 방법은 다음과 같습니다. # 필요한 모듈 가져오기 from pyspark import SparkConf, SparkContext # Spark 설정 객체 생성 config = SparkConf().setMaster("local[*]").setAppName("example_app") # SparkContext 생성 context = SparkContext(conf=config) # 현재 PySpark 버전 출력 print(context.ver ...

6월 6일 20:05에 게시됨