PySpark के साथ Big Data Fundamentals
Upendra Devisetty
Science Analyst, CyVerse
Volume, Variety और Velocity
Volume: डेटा का आकार
Variety: अलग-अलग स्रोत और फ़ॉर्मैट
Velocity: डेटा की रफ़्तार
Clustered computing: कई मशीनों के संसाधनों का संग्रह
Parallel computing: एक ही कंप्यूटर पर साथ-साथ गणना
Distributed computing: नोड्स (नेटवर्क्ड कंप्यूटर्स) का समूह जो समानांतर चलता है
Batch processing: जॉब को छोटे हिस्सों में बाँटकर अलग मशीनों पर चलाना
Real-time processing: डेटा का त्वरित प्रोसेसिंग
Hadoop/MapReduce: Java में लिखा स्केलेबल और फ़ॉल्ट-टॉलरेंट फ़्रेमवर्क
ओपन सोर्स
बैच प्रोसेसिंग
Apache Spark: जनरल-परपज़ और बेहद तेज़ क्लस्टर कंप्यूटिंग सिस्टम
ओपन सोर्स
बैच और रियल-टाइम दोनों प्रकार की प्रोसेसिंग
नोट: आजकल Apache Spark, Hadoop/MapReduce से अधिक पसंद किया जाता है
डिस्ट्रीब्यूटेड क्लस्टर कंप्यूटिंग फ़्रेमवर्क
बड़े डेटा सेट्स के लिए कुशल इन-मेmemory कम्प्यूटेशंस
बेहद तेज़ डेटा प्रोसेसिंग फ़्रेमवर्क
Java, Scala, Python, R और SQL का सपोर्ट देता है

Local mode: एक मशीन, जैसे आपका लैपटॉप
Cluster mode: पूर्व-परिभाषित मशीनों का सेट
वर्कफ़्लो: Local -> clusters
कोड बदलने की ज़रूरत नहीं
PySpark के साथ Big Data Fundamentals