Fundamentele Big Data cu PySpark
Upendra Devisetty
Science Analyst, CyVerse


Transformări RDD de bază
map(), filter(), flatMap() și union()
RDD = sc.parallelize([1,2,3,4])
RDD_map = RDD.map(lambda x: x * x)

RDD = sc.parallelize([1,2,3,4])
RDD_filter = RDD.filter(lambda x: x > 2)

RDD = sc.parallelize(["hello world", "how are you"])
RDD_flatmap = RDD.flatMap(lambda x: x.split(" "))

inputRDD = sc.textFile("logs.txt")
errorRDD = inputRDD.filter(lambda x: "error" in x.split())
warningsRDD = inputRDD.filter(lambda x: "warnings" in x.split())
combinedRDD = errorRDD.union(warningsRDD)
Sunt operații care returnează o valoare după efectuarea unui calcul pe RDD
Acțiuni RDD de bază
collect()
take(N)
first()
count()
collect() returnează toate elementele setului de date ca un array
take(N) returnează un array cu primele N elemente ale setului de date
RDD_map.collect()
[1, 4, 9, 16]
RDD_map.take(2)
[1, 4]
RDD_map.first()
[1]
RDD_flatmap.count()
5
Fundamentele Big Data cu PySpark