Bigmemory पैकेजों का सूट

R में Scalable Data Processing

Michael Kane

Assistant Professor, Yale University

अब तक..

  • Import
  • Subset
  • big.matrix ऑब्जेक्ट्स में मान असाइन करें
R में Scalable Data Processing

संबद्ध पैकेज

टेबल और सारांश
  • biganalytics
  • bigtabulate
R में Scalable Data Processing

संबद्ध पैकेज

रैखिक बीजगणित
  • bigalgebra
R में Scalable Data Processing

संबद्ध पैकेज

मॉडल फिट करें
  • bigpca
  • bigFastLM
  • biglasso
  • bigrf
R में Scalable Data Processing

FHFA का मॉर्गेज डेटासेट

  • 2009-2015 के बीच Federal National Mortgage Association (Fannie Mae) और Federal Home Loan Mortgage Corporation (Freddie Mac) दोनों द्वारा होल्ड या सेक्यूरिटाइज़ की गई मॉर्गेजेस
  • FHFA मॉर्गेज डेटा ऑनलाइन यहाँ उपलब्ध है
  • हम 70000 लोन के एक रैंडम सबसेट पर फोकस करेंगे
R में Scalable Data Processing

पहला उदाहरण: bigmemory के साथ bigtabulate

library(bigtabulate)

# हमारे पास प्रति वर्ष कितने सैंपल हैं? bigtable(mort, "year")
 2008  2009  2010  2011  2012  2013  2014  2015 
 8468 11101  8836  7996 10935 10216  5714  6734
# nested टेबल बनाएँ
bigtable(mort, c("msa", "year"))
  2008 2009 2010 2011 2012 2013 2014 2015
0 1064 1343  998  851 1066 1005  504  564
1 7404 9758 7838 7145 9869 9211 5210 6170
R में Scalable Data Processing

अभ्यास करते हैं!

R में Scalable Data Processing

Preparing Video For Download...