반복문 대신 사용하는 pandas

효율적인 Python 코드 작성

Logan Thomas

Scientific Software Technical Trainer, Enthought

print(baseball_df.head())
  Team League  Year   RS   RA   W    G  Playoffs
0  ARI     NL  2012  734  688  81  162         0
1  ATL     NL  2012  700  600  94  162         1
2  BAL     AL  2012  712  705  93  162         1
3  BOS     AL  2012  734  806  69  162         0
4  CHC     NL  2012  613  759  61  162         0
def calc_run_diff(runs_scored, runs_allowed):

    run_diff = runs_scored - runs_allowed

    return run_diff
효율적인 Python 코드 작성

반복문으로 득실점 차 계산

run_diffs_iterrows = []

for i,row in baseball_df.iterrows():
    run_diff = calc_run_diff(row['RS'], row['RA'])
    run_diffs_iterrows.append(run_diff)

baseball_df['RD'] = run_diffs_iterrows
print(baseball_df)
     Team League  Year   RS   RA    W    G  Playoffs   RD
0     ARI     NL  2012  734  688   81  162         0   46
1     ATL     NL  2012  700  600   94  162         1  100
2     BAL     AL  2012  712  705   93  162         1    7
...
효율적인 Python 코드 작성

pandas .apply() 메서드

  • 함수를 받아 DataFrame에 적용합니다
    • 적용할 축을 지정해야 함 (0은 열, 1은 행)
  • 익명 함수(lambda)와 함께 사용 가능
  • 예시:
baseball_df.apply(

lambda row: calc_run_diff(row['RS'], row['RA']),
axis=1 )
효율적인 Python 코드 작성

.apply()로 득실점 차 계산

run_diffs_apply = baseball_df.apply(
         lambda row: calc_run_diff(row['RS'], row['RA']),
         axis=1)

baseball_df['RD'] = run_diffs_apply print(baseball_df)
     Team League  Year   RS   RA    W    G  Playoffs   RD
0     ARI     NL  2012  734  688   81  162         0   46
1     ATL     NL  2012  700  600   94  162         1  100
2     BAL     AL  2012  712  705   93  162         1    7
...
효율적인 Python 코드 작성

접근 방식 비교

%%timeit
run_diffs_iterrows = []

for i,row in baseball_df.iterrows():
    run_diff = calc_run_diff(row['RS'], row['RA'])
    run_diffs_iterrows.append(run_diff)

baseball_df['RD'] = run_diffs_iterrows
회당 86.8 ms ± 3 ms (7회 실행, 각 10회 루프의 평균 ± 표준편차)
효율적인 Python 코드 작성

접근 방식 비교

%%timeit
run_diffs_apply = baseball_df.apply(
         lambda row: calc_run_diff(row['RS'], row['RA']),
         axis=1)

baseball_df['RD'] = run_diffs_apply
회당 30.1 ms ± 1.75 ms (7회 실행, 각 10회 루프의 평균 ± 표준편차)
효율적인 Python 코드 작성

pandas .apply() 메서드로 연습해 봅시다!

효율적인 Python 코드 작성

Preparing Video For Download...