Cân nhắc cho dữ liệu phân loại

Phân tích dữ liệu khám phá trong Python

George Boorman

Curriculum Manager, DataCamp

Vì sao thực hiện EDA?

  • Phát hiện mẫu và mối quan hệ

 

 

  • Tạo câu hỏi, hay giả thuyết

 

 

  • Chuẩn bị dữ liệu cho machine learning

Dấu hỏi bằng đèn neon đỏ

1 Image credit: https://unsplash.com/@simonesecci
Phân tích dữ liệu khám phá trong Python

Dữ liệu đại diện

  • Mẫu đại diện cho quần thể

Ví dụ:

  • Giáo dục so với thu nhập tại Mỹ
    • Không thể dùng dữ liệu từ Pháp

Cờ Mỹ

Cờ Pháp

1 Image credits: https://unsplash.com/@cristina_glebova; https://unsplash.com/@nimbus_vulpis
Phân tích dữ liệu khám phá trong Python

Các lớp phân loại

  • Lớp = nhãn

 

  • Khảo sát thái độ với hôn nhân
    • Tình trạng hôn nhân
      • Độc thân
      • Đã kết hôn
      • Ly hôn
Phân tích dữ liệu khám phá trong Python

Mất cân bằng lớp

biểu đồ cột hiển thị số lượng tình trạng hôn nhân trong mẫu - 700 ly hôn, 250 độc thân, và 50 đã kết hôn

Phân tích dữ liệu khám phá trong Python

Tần suất lớp

print(planes["Destination"].value_counts())
Cochin       4391
Banglore     2773
Delhi        1219
New Delhi     888
Hyderabad     673
Kolkata       369
Name: Destination, dtype: int64
Phân tích dữ liệu khám phá trong Python

Tần suất lớp tương đối

  • 40% chuyến bay nội địa Ấn Độ đến Delhi
planes["Destination"].value_counts(normalize=True)
Cochin       0.425773
Banglore     0.268884
Delhi        0.118200
New Delhi    0.086105
Hyderabad    0.065257
Kolkata      0.035780
Name: Destination, dtype: float64
  • Mẫu có đại diện cho quần thể (các chuyến bay nội địa Ấn Độ) không?
Phân tích dữ liệu khám phá trong Python

Bảng chéo (cross-tab)

Gọi pd-dot-crosstab

pd.crosstab(
Phân tích dữ liệu khám phá trong Python

Chọn chỉ mục

Chọn cột làm chỉ mục

pd.crosstab(planes["Source"],
Phân tích dữ liệu khám phá trong Python

Chọn cột

Chọn cột

pd.crosstab(planes["Source"], planes["Destination"])
Phân tích dữ liệu khám phá trong Python

Bảng chéo

Destination  Banglore  Cochin  Delhi  Hyderabad  Kolkata  New Delhi
Source                                                             
Banglore            0       0   1199          0        0        868
Chennai             0       0      0          0      364          0
Delhi               0    4318      0          0        0          0
Kolkata          2720       0      0          0        0          0
Mumbai              0       0      0        662        0          0
Phân tích dữ liệu khám phá trong Python

Mở rộng bảng chéo

Source Destination Giá trị trung vị (IDR)
Banglore Delhi 4232.21
Banglore New Delhi 12114.56
Chennai Kolkata 3859.76
Delhi Cochin 9987.63
Kolkata Banglore 9654.21
Mumbai Hyderabad 3431.97
Phân tích dữ liệu khám phá trong Python

Giá trị tổng hợp với pd.crosstab()

pd.crosstab(planes["Source"], planes["Destination"],

values=planes["Price"], aggfunc="median")
Destination  Banglore   Cochin   Delhi  Hyderabad  Kolkata  New Delhi
Source                                                               
Banglore          NaN      NaN  4823.0        NaN      NaN    10976.5
Chennai           NaN      NaN     NaN        NaN   3850.0        NaN
Delhi             NaN  10262.0     NaN        NaN      NaN        NaN
Kolkata        9345.0      NaN     NaN        NaN      NaN        NaN
Mumbai            NaN      NaN     NaN     3342.0      NaN        NaN
Phân tích dữ liệu khám phá trong Python

So sánh mẫu với quần thể

Source Destination Giá trị trung vị (IDR) Trung vị (toàn bộ tập)
Banglore Delhi 4232.21 4823.0
Banglore New Delhi 12114.56 10976.50
Chennai Kolkata 3859.76 3850.0
Delhi Cochin 9987.63 10260.0
Kolkata Banglore 9654.21 9345.0
Mumbai Hyderabad 3431.97 3342.0
Phân tích dữ liệu khám phá trong Python

Ayo berlatih!

Phân tích dữ liệu khám phá trong Python

Preparing Video For Download...