Podstawy Big Data z PySpark
Upendra Devisetty
Science Analyst, CyVerse
Apache Spark jest napisany w języku Scala
Aby obsługiwać Pythona ze Sparkiem, społeczność Apache Spark udostępniła PySpark
Podobna szybkość i moc obliczeniowa jak w Scali
API PySpark jest podobne do Pandas i Scikit-learn
Interaktywne środowisko do uruchamiania zadań Spark
Przydatne do szybkiego prototypowania interaktywnego
Powłoki Spark umożliwiają pracę z danymi na dysku lub w pamięci
Trzy różne powłoki Spark:
Spark-shell dla Scali
PySpark-shell dla Pythona
SparkR dla R
Powłoka PySpark to narzędzie wiersza poleceń oparte na Pythonie
Powłoka PySpark umożliwia naukowcom danych pracę ze strukturami danych Spark
Powłoka PySpark obsługuje łączenie z klastrem
SparkContext jest punktem wejścia do świata Spark
Punkt wejścia to sposób łączenia się z klastrem Spark
Punkt wejścia działa jak klucz do domu
PySpark ma domyślny SparkContext o nazwie sc
sc.version
2.3.1
sc.pythonVer
3.6
sc.master
local[*]
parallelize() SparkContextrdd = sc.parallelize([1,2,3,4,5])
textFile() SparkContextrdd2 = sc.textFile("test.txt")
Podstawy Big Data z PySpark