Preparazione dei dati

Comprendere la Data Science

Hadrien Lacroix

Content Developer, DataCamp

Flusso dati

data science workflow

Comprendere la Data Science

Perché preparare i dati?

  • I dati reali sono disordinati
  • La preparazione dei dati serve a prevenire:
    • errori
    • risultati errati
    • introdurre bias negli algoritmi

preparing soup

Comprendere la Data Science

Iniziamo a fare pulizia

Sara Lis Hadrien Lis
Age "27" "30" "30"
Statura 1.77 5.58 1.80 5.58
Paese "Belgio" "USA" "FR" "USA"

scraper-cleaning-window

Comprendere la Data Science

Dati ordinati

Prima

$$

Sara Lis Hadrien Lis
Age "27" "30" "30"
Statura 1.77 5.58 1.80 5.58
Paese "Belgio" "USA" "FR" "USA"

folded-laundry

Comprendere la Data Science

Output dati ordinati

Prima

$$

Sara Lis Hadrien Lis
Age "27" "30" "30"
Statura 1.77 5.58 1.80 5.58
Paese "Belgio" "USA" "FR" "USA"

Dopo

$$

Nome Età Statura Paese
Sara "26" 1.78 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"
Lis "30" 5.58 "USA"
Comprendere la Data Science

Rimuovere duplicati

Prima

$$

Nome Età Statura Paese
Sara "27" 1.77 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"
Lis "30" 5.58 "USA"

double-cherry

Comprendere la Data Science

Rimuovere duplicati | output

Prima

$$

Nome Età Statura Paese
Sara "27" 1.77 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"
Lis "30" 5.58 "USA"

Dopo

$$

Nome Età Statura Paese
Sara "27" 1.77 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"
Comprendere la Data Science

ID univoco

Prima

$$

Nome Età Statura Paese
Sara "27" 1.77 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"

purple-duck-with-yellow-ducks

Comprendere la Data Science

ID univoco | output

Prima

$$

Nome Età Statura Paese
Sara "27" 1.77 "Belgio"
Lis "30" 5.58 "USA"
Hadrien 1.80 "FR"

Dopo

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 5.58 "USA"
2 Hadrien 1.80 "FR"
Comprendere la Data Science

Omogeneità

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 5.58 "USA"
2 Hadrien 1.80 "FR"

small-goldfish-facing-large-goldfish

Comprendere la Data Science

Omogeneità | output

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 5.58 "USA"
2 Hadrien 1.80 "FR"

Dopo

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 1.70 "USA"
2 Hadrien 1.80 "FR"
Comprendere la Data Science

Omogeneità, ancora una volta

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 1.70 "USA"
2 Hadrien 1.80 "FR"

belgian-flag

Comprendere la Data Science

Omogeneità, ancora una volta | output

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "Belgio"
1 Lis "30" 1.70 "US"
2 Hadrien 1.80 "FR"

Dopo

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "BE"
1 Lis "30" 1.70 "US"
2 Hadrien 1.80 "FR"
Comprendere la Data Science

Tipi di dati

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "BE"
1 Lis "30" 1.70 "US"
2 Hadrien 1.80 "FR"

different-types-of-pasta

Comprendere la Data Science

Tipi di dati | output

Prima

$$

ID Nome Età Statura Paese
0 Sara "27" 1.77 "BE"
1 Lis "30" 1.70 "US"
2 Hadrien 1.80 "FR"

Dopo

$$

ID Nome Età Statura Paese
0 Sara 27 1.77 "BE"
1 Lis 30 1.70 "US"
2 Hadrien 1.80 "FR"
Comprendere la Data Science

Valori mancanti

Prima

$$

ID Nome Età Statura Paese
0 Sara 27 1.77 "BE"
1 Lis 30 1.70 "US"
2 Hadrien 1.80 "FR"

Motivi:

  • inserimento dati
  • errore
  • valore mancante valido

Soluzioni:

  • imputa
  • elimina
  • mantieni
Comprendere la Data Science

Valori mancanti | output

Prima

$$

ID Nome Età Statura Paese
0 Sara 27 1.77 "BE"
1 Lis 30 1.70 "USA"
2 Hadrien 1.80 "FR"

Dopo

$$

ID Nome Età Statura Paese
0 Sara 27 1.77 "BE"
1 Lis 30 1.70 "US"
2 Hadrien 28 1.80 "FR"
Comprendere la Data Science

Esercitiamoci!

Comprendere la Data Science

Preparing Video For Download...