शुरुआत कहाँ से करें

PySpark के साथ Feature Engineering

John Hogue

Lead Data Scientist, General Mills

सीधे विश्लेषण में कूदना

यहाँ दैत्य हैं

  • अपना खुद का विशेषज्ञ बनें
  • विश्लेषण के लक्ष्य तय करें
  • अपने डेटा पर शोध करें
  • जिज्ञासु रहें, सवाल पूछें

दैत्य

PySpark के साथ Feature Engineering

डेटा साइंस प्रक्रिया

डेटा साइंस प्रक्रिया

PySpark के साथ Feature Engineering

Spark तेज़ी से और अक्सर बदलता है

PySpark के साथ Feature Engineering

डेटा फॉर्मेट: Parquet

डेटा Parquet में दिया गया है

  • कॉलम-वार स्टोरेज
    • कॉलम सबसेट क्वेरी तेज़
  • स्ट्रक्चर्ड, परिभाषित स्कीमा
    • फ़ील्ड और डेटा टाइप तय
    • गंदे टेक्स्ट डेटा के लिए बढ़िया
  • इंडस्ट्री अपनाया हुआ
    • यह स्किल काफ़ी काम की है! 😃

Parquet फ़ाइल फॉर्मेट

PySpark के साथ Feature Engineering

डेटा को Spark में लाना

PySpark read मेथड्स

  • PySpark कई फ़ाइल टाइप सपोर्ट करता है!
# JSON
spark.read.json('example.json')
# CSV या delimited फ़ाइलें
spark.read.csv('example.csv')
# Parquet
spark.read.parquet('example.parq')
# एक parquet फ़ाइल को PySpark DataFrame में पढ़ें
df = spark.read.parquet('example.parq')
PySpark के साथ Feature Engineering

अभ्यास करते हैं!

PySpark के साथ Feature Engineering

Preparing Video For Download...