iotools का पहला परिचय: डेटा आयात

R में Scalable Data Processing

Simon Urbanek

Member of R-Core, Lead Inventive Scientist, AT&T Labs Research

चंक-वाइज़ प्रोसेसिंग

  1. डेटा के टुकड़े लोड करें
  2. उन्हें नेटिव ऑब्जेक्ट्स में बदलें
  3. कंप्यूटेशन करें और परिणाम सहेजें

जब तक सारा डेटा प्रोसेस न हो जाए, 1 से 3 दोहराएँ

R में Scalable Data Processing

डेटा आयात

  • अक्सर डेटा लोड करना प्रोसेसिंग से ज्यादा समय लेता है, और यह 2 चरणों में होता है
    • डिस्क से डेटा लाना अपेक्षाकृत धीमा ऑपरेशन है
    • कच्चे डेटा को नेटिव R ऑब्जेक्ट्स में बदलना
R में Scalable Data Processing

iotools से डेटा आयात

iotools पैकेज में, बेहतर लचीलापन और परफॉर्मेंस के लिए डेटा का भौतिक लोडिंग और उसे R ऑब्जेक्ट्स में पार्स करना अलग-अलग किया गया है.

R में Scalable Data Processing

iotools: डेटा आयात

  • readAsRaw() पूरा डेटा एक raw वेक्टर में पढ़ता है
  • read.chunk() डेटा को चंक्स में raw वेक्टर में पढ़ता है
R में Scalable Data Processing

iotools: डेटा पार्सिंग

  • mstrsplit() raw डेटा को एक मैट्रिक्स में बदलता है
  • dstrsplit() raw डेटा को एक data frame में बदलता है
R में Scalable Data Processing

iotools: डेटा लोडिंग और पार्सिंग

read.delim.raw() = readAsRaw() + dstrsplit()

R में Scalable Data Processing

चंक-वाइज़ प्रोसेसिंग

  • सारा डेटा आयात करना जरूरी नहीं
  • डेटा सोर्स से एक समय में पंक्तियों का एक "chunk" पढ़ें
  • कोई intermediate स्ट्रक्चर नहीं
R में Scalable Data Processing

फाइल कनेक्शंस

# Open a file connection
fc <- file("data-file.csv", "rb")
# Read the first line if the data has a header
readLines(fc, n = 1)
....
# Code to import and parse the data
....
# Close the file connection
close(fc)
R में Scalable Data Processing

अभ्यास करते हैं!

R में Scalable Data Processing

Preparing Video For Download...