Pandas 시리즈 벡터화

pandas로 효율적인 코드 작성하기

Leonidas Souliotis

PhD Candidate

배열로서의 DataFrame

GitHub 로고

pandas로 효율적인 코드 작성하기

pandas 벡터화 수행 방법

start_time = time.time()
poker[['R1', 'R2', 'R3', 'R4', 'R5']].sum(axis=1)
print("Time using pandas vectorization: {} sec".format(time.time() - start_time))
Time using pandas vectorization: 0.0026819705 sec
poker[['R1', 'R2', 'R3', 'R4', 'R5']].sum(axis=1).head()
|              |    | 
|--------------|----| 
| 0            | 47 | 
| 1            | 47 | 
| 2            | 47 | 
| 3            | 47 | 
| 4            | 47 | 
| dtype: int64 | -- |
pandas로 효율적인 코드 작성하기

이전 방식과의 비교

data_generator = data.iterrows()

start_time = time.time()
for index, value in data_generator:
        sum([value[1], value[3], value[5], value[7]])
print("Time using .iterrows(){} seconds" % (time.time() - start_time))
위 연산 소요 시간: 3.37918996초
start_time = time.time()
data[['R1', 'R2', 'R3', 'R4', 'R5']].apply(lambda x: sum(x),axis=1)
print("Results from the above operation calculated in %s seconds" % (time.time() - start_time))
위 연산 소요 시간: 0.637711048초
- 벡터화 vs `.iterows()` 차이: 111,800.75%
- 벡터화 vs `.apply()` 차이: 20,853%
pandas로 효율적인 코드 작성하기

직접 해봅시다!

pandas로 효율적인 코드 작성하기

Preparing Video For Download...