Зчитування, огляд і очищення даних з CSV

Імпорт і керування фінансовими даними в Python

Stefan Jansen

Instructor

Імпорт і очищення даних

  • Переконайтеся, що pd.DataFrame() відповідає джерелу CSV
  • Лістинги біржі: amex-listings.csv

Дані AmEx

Імпорт і керування фінансовими даними в Python

Як pandas зберігає дані

  • Кожен стовпець має свій формат даних (dtype)
  • dtype впливає на обчислення й візуалізацію
pandas dtype Характеристики стовпця
object Текст або суміш тексту й чисел
int64 Числові: цілі числа — 64 біти ($\le 2^{64}$)
float64 Числові: десяткові або цілі з пропусками
datetime64 Дата та час
Імпорт і керування фінансовими даними в Python

Імпорт і огляд

import pandas as pd

amex = pd.read_csv('amex-listings.csv')
amex.info() # To inspect table structure & data types
RangeIndex: 360 entries, 0 to 359
Data columns (total 8 columns):
 #   Column                 Non-Null Count  Dtype  
 --  ------                 --------------  -----  
 0   Stock Symbol           360 non-null    object 
 1   Company Name           360 non-null    object 
 2   Last Sale              346 non-null    float64
 3   Market Capitalization  360 non-null    float64
 4   IPO Year               105 non-null    float64
 5   Sector                 238 non-null    object 
 6   Industry               238 non-null    object 
 7   Last Update            360 non-null    object 
dtypes: float64(3), object(5)
Імпорт і керування фінансовими даними в Python

Робота з пропущеними значеннями

# Replace 'n/a' with np.nan
amex = pd.read_csv('amex-listings.csv', na_values='n/a')

amex.info()
RangeIndex: 360 entries, 0 to 359
Data columns (total 8 columns):
 #   Column                 Non-Null Count  Dtype  
 --  ------                 --------------  -----  
 0   Stock Symbol           360 non-null    object 
 1   Company Name           360 non-null    object 
 2   Last Sale              346 non-null    float64
 3   Market Capitalization  360 non-null    float64
 4   IPO Year               105 non-null    float64
 5   Sector                 238 non-null    object 
 6   Industry               238 non-null    object 
 7   Last Update            360 non-null    object 
dtypes: float64(3), object(5)
Імпорт і керування фінансовими даними в Python

Коректне парсення дат

amex = pd.read_csv('amex-listings.csv',
                   na_values='n/a',
                   parse_dates=['Last Update'])

amex.info()
RangeIndex: 360 entries, 0 to 359
Data columns (total 8 columns):
 #   Column                 Non-Null Count  Dtype         
 --  ------                 --------------  -----  
 0   Stock Symbol           360 non-null    object        
 1   Company Name           360 non-null    object        
 2   Last Sale              346 non-null    float64       
 3   Market Capitalization  360 non-null    float64       
 4   IPO Year               105 non-null    float64       
 5   Sector                 238 non-null    object        
 6   Industry               238 non-null    object        
 7   Last Update            360 non-null    datetime64[ns]
dtypes: datetime64[ns](1), float64(3), object(4)
Імпорт і керування фінансовими даними в Python

Перегляд результату

amex.head(2) # Show first n rows (default: 5)
  Stock Symbol   Company Name  
0         XXII   22nd Century Group, Inc   
1          FAX   Aberdeen Asia-Pacific Income Fund Inc   

   Last Sale  Market Capitalization  IPO Year  
0     1.3300           1.206285e+08       NaN  
1     5.0000           1.266333e+09    1986.0  

   Sector        Industry              Last Update  
0  Non-Durables  Farming/Seeds/Milling  2017-04-26  
1  NaN           NaN                    2017-04-25
Імпорт і керування фінансовими даними в Python

Давайте потренуємось!

Імпорт і керування фінансовими даними в Python

Preparing Video For Download...