Další akce

Big Data Fundamentals with PySpark

Upendra Devisetty

Science Analyst, CyVerse

Akce reduce()

  • Akce reduce(func) slouží k agregaci prvků běžného RDD

  • Funkce musí být komutativní (pořadí operandů nemění výsledek) a asociativní

  • Příklad akce reduce() v PySparku

x = [1,3,4,6]
RDD = sc.parallelize(x)
RDD.reduce(lambda x, y : x + y)
14
Big Data Fundamentals with PySpark

Akce saveAsTextFile()

  • Akce saveAsTextFile() uloží RDD do textového souboru v adresáři, každý oddíl jako samostatný soubor
RDD.saveAsTextFile("tempFile")
  • Metodou coalesce() lze uložit RDD jako jeden textový soubor
RDD.coalesce(1).saveAsTextFile("tempFile")
Big Data Fundamentals with PySpark

Akce na párových RDD

  • Akce RDD dostupné pro párová RDD v PySparku

  • Akce na párových RDD využívají data ve formátu klíč–hodnota

  • Příklady akcí na párových RDD

    • countByKey()

    • collectAsMap()

Big Data Fundamentals with PySpark

Akce countByKey()

  • countByKey() je dostupná pouze pro typ (K, V)

  • Akce countByKey() počítá počet prvků pro každý klíč

  • Příklad countByKey() na jednoduchém seznamu

rdd = sc.parallelize([("a", 1), ("b", 1), ("a", 1)])
for kee, val in rdd.countByKey().items():
  print(kee, val)
('a', 2)
('b', 1)
Big Data Fundamentals with PySpark

Akce collectAsMap()

  • collectAsMap() vrátí páry klíč–hodnota z RDD jako slovník

  • Příklad collectAsMap() na jednoduchém tuplu

sc.parallelize([(1, 2), (3, 4)]).collectAsMap()
{1: 2, 3: 4}
Big Data Fundamentals with PySpark

Pojďme procvičovat!

Big Data Fundamentals with PySpark

Preparing Video For Download...