Spojování podle klíčových sloupců

Pandas Joins pro uživatele tabulkových procesorů

John Miller

Principal Data Scientist

Postup (pokračování)

$$

Po zobrazení a pochopení dat:

  • Určete vztah
  • Zkontrolujte jedinečné hodnoty v klíčovém sloupci

čtverce

Pandas Joins pro uživatele tabulkových procesorů

Jedinečné klíčové sloupce

$$ $$ Jedinečné hodnoty pro jednosloupkový klíč

df.duplicated('GameKey').sum()

$$ -- -- Hodnota 0 znamená žádné duplicity -- --

df.duplicated(['GameKey', 'PlayId']).sum()

index s jedním sloupcem

vícesloupcový index

Pandas Joins pro uživatele tabulkových procesorů

Postup (pokračování)

$$

Po zobrazení a pochopení dat:

  • Určete vztah
  • Zkontrolujte jedinečné hodnoty v klíčovém sloupci
  • Napište příkaz pro spojení a spusťte ho

čtverce

Pandas Joins pro uživatele tabulkových procesorů

Provedení spojení

$$

Příkaz je stejný!

df1.merge(df2, how='inner', on='')

  • Pozor na parametry

$$

Úplná syntaxe: DataFrame.merge(right, how='inner', on=None, left_on=None, right_on=None, left_index=False, right_index=False, sort=False, suffixes=('_x', '_y'), indicator=False, validate=None)

Pandas Joins pro uživatele tabulkových procesorů

Ověřování spojení

DataFrame.merge(right, how='inner', on=None, left_on=None, right_on=None, left_index=False, right_index=False, sort=False, suffixes=('_x', '_y'), indicator=False, validate=None)

$$

Hodnoty parametru validate:

  • "one_to_one" nebo "1:1"
  • "one_to_many" nebo "1:m"
  • "many_to_one" nebo "m:1"
  • "many_to_many" nebo "m:m" (neprovádí nic)
Pandas Joins pro uživatele tabulkových procesorů

Pojďme si procvičit!

Pandas Joins pro uživatele tabulkových procesorů

Preparing Video For Download...