Načítání více tabulek pomocí joinů

Streamlined Data Ingestion with pandas

Amany Mahfouz

Instructor

Klíče

  • Záznamy v databázi mají jedinečné identifikátory neboli klíče

Data hovorů 311 se zvýrazněným sloupcem unique_key. Jedinečné klíče jsou čísla.

Streamlined Data Ingestion with pandas

Klíče

  • Záznamy v databázi mají jedinečné identifikátory neboli klíče

Data katalogu kurzů se zvýrazněným sloupcem course_code. Kódy sestávají ze zkratek předmětů a čísel.

Streamlined Data Ingestion with pandas

Klíče

  • Záznamy v databázi mají jedinečné identifikátory neboli klíče

Data katalogu kurzů se zvýrazněným sloupcem instructor_id. Hodnoty jsou 9ciferná celá čísla.

Streamlined Data Ingestion with pandas

Klíče

Tabulka profesorů se zvýrazněným sloupcem id. Hodnoty jsou 9ciferná celá čísla jako instructor_id v katalogu kurzů.

Streamlined Data Ingestion with pandas

Klíče

Data katalogu kurzů s připojeným sloupcem jmen profesorů

Streamlined Data Ingestion with pandas

Spojování tabulek

Data o počasí se zvýrazněným sloupcem date

Data hovorů 311 se zvýrazněným sloupcem created_date

Streamlined Data Ingestion with pandas

Spojování tabulek

SELECT *
  FROM hpd311calls
Streamlined Data Ingestion with pandas

Spojování tabulek

SELECT *
  FROM hpd311calls
       JOIN weather 
       ON hpd311calls.created_date = weather.date;
  • Při práci s více tabulkami používejte tečkovou notaci (table.column)
  • Výchozí join vrací pouze záznamy, jejichž klíče se vyskytují v obou tabulkách
  • Klíče joinu musí mít stejný datový typ, jinak nedojde ke shodě
Streamlined Data Ingestion with pandas

Spojování a filtrování

/* Get only heat/hot water calls and join in weather data */
SELECT *
  FROM hpd311calls
       JOIN weather 
       ON hpd311calls.created_date = weather.date
 WHERE hpd311calls.complaint_type = 'HEAT/HOT WATER';
Streamlined Data Ingestion with pandas

Spojování a agregace

/* Get call counts by borough */
SELECT hpd311calls.borough, 
         COUNT(*)
  FROM hpd311calls
 GROUP BY hpd311calls.borough;
Streamlined Data Ingestion with pandas

Spojování a agregace

/* Get call counts by borough
   and join in population and housing counts */
SELECT hpd311calls.borough, 
       COUNT(*), 
       boro_census.total_population,
       boro_census.housing_units
  FROM hpd311calls
 GROUP BY hpd311calls.borough
Streamlined Data Ingestion with pandas

Spojování a agregace

/* Get call counts by borough
   and join in population and housing counts */
SELECT hpd311calls.borough, 
       COUNT(*), 
       boro_census.total_population,
       boro_census.housing_units
  FROM hpd311calls
       JOIN boro_census 
       ON hpd311calls.borough = boro_census.borough
 GROUP BY hpd311calls.borough;
Streamlined Data Ingestion with pandas
query = """SELECT hpd311calls.borough, 
                    COUNT(*), 
                    boro_census.total_population,
                    boro_census.housing_units
             FROM hpd311calls
                  JOIN boro_census 
                  ON hpd311calls.borough = boro_census.borough
            GROUP BY hpd311calls.borough;"""

call_counts = pd.read_sql(query, engine)
print(call_counts)
         borough  COUNT(*)  total_population  housing_units
0          BRONX     29874           1455846         524488
1       BROOKLYN     31722           2635121        1028383
2      MANHATTAN     20196           1653877         872645
3         QUEENS     11384           2339280         850422
4  STATEN ISLAND      1322            475948         179179
Streamlined Data Ingestion with pandas

Shrnutí

  • Pořadí klíčových slov v SQL
    • SELECT
    • FROM
    • JOIN
    • WHERE
    • GROUP BY
Streamlined Data Ingestion with pandas

Lass uns üben!

Streamlined Data Ingestion with pandas

Preparing Video For Download...