PySpark के साथ Big Data Fundamentals
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark, Scala में लिखा गया है
Python सपोर्ट के लिए, Apache Spark कम्युनिटी ने PySpark जारी किया
Scala जैसी ही गति और कंप्यूट शक्ति
PySpark APIs, Pandas और Scikit-learn जैसी हैं
Spark जॉब्स चलाने के लिए इंटरएक्टिव वातावरण
तेज़ इंटरएक्टिव प्रोटोटाइपिंग के लिए उपयोगी
Spark shells डिस्क या मेमोरी में डेटा से इंटरेक्ट करने देते हैं
तीन Spark shells:
Scala के लिए Spark-shell
Python के लिए PySpark-shell
R के लिए SparkR
PySpark shell, Python-आधारित कमांड लाइन टूल है
यह डेटा साइंटिस्ट्स को Spark डेटा स्ट्रक्चर से इंटरेक्ट करने देता है
PySpark shell क्लस्टर से कनेक्ट करना सपोर्ट करता है
SparkContext, Spark की दुनिया में एंट्री पॉइंट है
एंट्री पॉइंट, Spark क्लस्टर से कनेक्ट होने का तरीका है
एंट्री पॉइंट घर की चाबी जैसा है
PySpark में डिफॉल्ट SparkContext sc होता है
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() मेथडrdd = sc.parallelize([1,2,3,4,5])
textFile() मेथडrdd2 = sc.textFile("test.txt")
PySpark के साथ Big Data Fundamentals