Big Data की बुनियाद

PySpark के साथ Big Data Fundamentals

Upendra Devisetty

Science Analyst, CyVerse

Big Data क्या है?

  • Big data वह शब्द है जो ऐसे डेटा सेट्स के अध्ययन और उपयोग के लिए होता है जो पारंपरिक डेटा-प्रोसेसिंग सॉफ्टवेयर के लिए बहुत जटिल हों - Wikipedia
PySpark के साथ Big Data Fundamentals

Big Data के 3 V

  • Volume, Variety और Velocity

  • Volume: डेटा का आकार

  • Variety: अलग-अलग स्रोत और फ़ॉर्मैट

  • Velocity: डेटा की रफ़्तार

PySpark के साथ Big Data Fundamentals

Big Data अवधारणाएँ और शब्दावली

  • Clustered computing: कई मशीनों के संसाधनों का संग्रह

  • Parallel computing: एक ही कंप्यूटर पर साथ-साथ गणना

  • Distributed computing: नोड्स (नेटवर्क्ड कंप्यूटर्स) का समूह जो समानांतर चलता है

  • Batch processing: जॉब को छोटे हिस्सों में बाँटकर अलग मशीनों पर चलाना

  • Real-time processing: डेटा का त्वरित प्रोसेसिंग

PySpark के साथ Big Data Fundamentals

Big Data प्रोसेसिंग सिस्टम्स

  • Hadoop/MapReduce: Java में लिखा स्केलेबल और फ़ॉल्ट-टॉलरेंट फ़्रेमवर्क

    • ओपन सोर्स

    • बैच प्रोसेसिंग

  • Apache Spark: जनरल-परपज़ और बेहद तेज़ क्लस्टर कंप्यूटिंग सिस्टम

    • ओपन सोर्स

    • बैच और रियल-टाइम दोनों प्रकार की प्रोसेसिंग

  • नोट: आजकल Apache Spark, Hadoop/MapReduce से अधिक पसंद किया जाता है

PySpark के साथ Big Data Fundamentals

Apache Spark फ़्रेमवर्क की विशेषताएँ

  • डिस्ट्रीब्यूटेड क्लस्टर कंप्यूटिंग फ़्रेमवर्क

  • बड़े डेटा सेट्स के लिए कुशल इन-मेmemory कम्प्यूटेशंस

  • बेहद तेज़ डेटा प्रोसेसिंग फ़्रेमवर्क

  • Java, Scala, Python, R और SQL का सपोर्ट देता है

PySpark के साथ Big Data Fundamentals

Apache Spark के कॉम्पोनेन्ट्स

spark

PySpark के साथ Big Data Fundamentals

Spark डिप्लॉयमेंट मोड्स

  • Local mode: एक मशीन, जैसे आपका लैपटॉप

    • लोकल मोड टेस्टिंग, डिबगिंग और डेमो के लिए सुविधाजनक
  • Cluster mode: पूर्व-परिभाषित मशीनों का सेट

    • प्रोडक्शन के लिए उपयुक्त
  • वर्कफ़्लो: Local -> clusters

  • कोड बदलने की ज़रूरत नहीं

PySpark के साथ Big Data Fundamentals

आगे क्या है - PySpark

PySpark के साथ Big Data Fundamentals

Preparing Video For Download...