Introduction à JSON

Ingestion de données rationalisée avec pandas

Amany Mahfouz

Instructor

Javascript Object Notation (JSON)

  • Format Web courant
  • Non tabulaire
    • Les enregistrements n'ont pas tous besoin des mêmes attributs
  • Données organisées en collections d'objets
  • Les objets sont des paires attribut‑valeur
  • JSON imbriqué : des objets dans des objets
Ingestion de données rationalisée avec pandas

Lire des données JSON

  • read_json()
    • Accepte un chemin vers un JSON ou des données JSON sous forme de chaîne
    • Précisez les types avec l'argument dtype
    • Argument orient pour signaler des dispositions JSON moins courantes
      • valeurs possibles dans la doc de pandas
Ingestion de données rationalisée avec pandas

Orientation des données

  • Les données JSON ne sont pas tabulaires
    • pandas déduit comment les mettre en table
  • pandas gère automatiquement les orientations courantes
Ingestion de données rationalisée avec pandas

Orientation par enregistrement

  • Disposition JSON la plus courante
    [
      {
          "age_adjusted_death_rate": "7.6",
          "death_rate": "6.2",
          "deaths": "32",
          "leading_cause": "Accidents Except Drug Posioning (V01-X39, X43, X45-X59, Y85-Y86)",
          "race_ethnicity": "Asian and Pacific Islander",
          "sex": "F",
          "year": "2007"
      },
      {
          "age_adjusted_death_rate": "8.1",
          "death_rate": "8.3",
          "deaths": "87",
          ...
    
Ingestion de données rationalisée avec pandas

Orientation par colonne

  • Plus économe en espace que l'orientation par enregistrement
    {
      "age_adjusted_death_rate": {
          "0": "7.6",
          "1": "8.1",
          "2": "7.1",
          "3": ".",
          "4": ".",
          "5": "7.3",
          "6": "13",
          "7": "20.6",
          "8": "17.4",
          "9": ".",
          "10": ".",
          "11": "19.8",
          ...
    
Ingestion de données rationalisée avec pandas

Spécifier l'orientation

  • Données orientées « split » – nyc_death_causes.json
    {
      "columns": [
          "age_adjusted_death_rate",
          "death_rate",
          "deaths",
          "leading_cause",
          "race_ethnicity",
          "sex",
          "year"
      ],
      "index": [...],
      "data": [
          [
              "7.6",
    
Ingestion de données rationalisée avec pandas

Spécifier l'orientation

import pandas as pd

death_causes = pd.read_json("nyc_death_causes.json", orient="split")
print(death_causes.head())
  age_adjusted_death_rate death_rate deaths             leading_cause              race_ethnicity sex  year
0                     7.6        6.2     32  Accidents Except Drug...  Asian and Pacific Islander   F  2007
1                     8.1        8.3     87  Accidents Except Drug...          Black Non-Hispanic   F  2007
2                     7.1        6.1     71  Accidents Except Drug...                    Hispanic   F  2007
3                       .          .      .  Accidents Except Drug...          Not Stated/Unknown   F  2007
4                       .          .      .  Accidents Except Drug...       Other Race/ Ethnicity   F  2007

[5 rows x 7 columns]
Ingestion de données rationalisée avec pandas

Passons à la pratique !

Ingestion de données rationalisée avec pandas

Preparing Video For Download...