PySpark: Python के साथ Spark

PySpark के साथ Big Data Fundamentals

Upendra Devisetty

Science Analyst, CyVerse

PySpark का ओवरव्यू

  • Apache Spark, Scala में लिखा गया है

  • Python सपोर्ट के लिए, Apache Spark कम्युनिटी ने PySpark जारी किया

  • Scala जैसी ही गति और कंप्यूट शक्ति

  • PySpark APIs, Pandas और Scikit-learn जैसी हैं

PySpark के साथ Big Data Fundamentals

Spark shell क्या है?

  • Spark जॉब्स चलाने के लिए इंटरएक्टिव वातावरण

  • तेज़ इंटरएक्टिव प्रोटोटाइपिंग के लिए उपयोगी

  • Spark shells डिस्क या मेमोरी में डेटा से इंटरेक्ट करने देते हैं

  • तीन Spark shells:

    • Scala के लिए Spark-shell

    • Python के लिए PySpark-shell

    • R के लिए SparkR

PySpark के साथ Big Data Fundamentals

PySpark shell

  • PySpark shell, Python-आधारित कमांड लाइन टूल है

  • यह डेटा साइंटिस्ट्स को Spark डेटा स्ट्रक्चर से इंटरेक्ट करने देता है

  • PySpark shell क्लस्टर से कनेक्ट करना सपोर्ट करता है

PySpark के साथ Big Data Fundamentals

SparkContext समझना

  • SparkContext, Spark की दुनिया में एंट्री पॉइंट है

  • एंट्री पॉइंट, Spark क्लस्टर से कनेक्ट होने का तरीका है

  • एंट्री पॉइंट घर की चाबी जैसा है

  • PySpark में डिफॉल्ट SparkContext sc होता है

1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark के साथ Big Data Fundamentals

SparkContext निरीक्षण

  • Version: SparkContext का वर्ज़न पाने के लिए
sc.version
2.3.1
  • Python Version: SparkContext का Python वर्ज़न पाने के लिए
sc.pythonVer
3.6
  • Master: क्लस्टर का URL, या SparkContext के लोकल मोड के लिए local स्ट्रिंग
sc.master
local[*]
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark के साथ Big Data Fundamentals

PySpark में डेटा लोड करना

  • SparkContext का parallelize() मेथड
rdd = sc.parallelize([1,2,3,4,5])
  • SparkContext का textFile() मेथड
rdd2 = sc.textFile("test.txt")
1 https://www.datacamp.com/cheat-sheet/pyspark-cheat-sheet-spark-in-python
PySpark के साथ Big Data Fundamentals

अभ्यास करते हैं

PySpark के साथ Big Data Fundamentals

Preparing Video For Download...