การสร้างชุดข้อมูล train, test และ validation

การตรวจสอบความถูกต้องของโมเดลใน Python

Kasey Jones

Data Scientist

การแบ่ง train/test แบบดั้งเดิม

  • ข้อมูลที่เคยเห็น (ใช้สำหรับ training)
  • ข้อมูลที่ไม่เคยเห็น (ไม่ได้ใช้ใน training)

การแบ่งข้อมูลคือการนำข้อมูลส่วนหนึ่งไปใช้ train และอีกส่วนหนึ่งไปใช้ test

การตรวจสอบความถูกต้องของโมเดลใน Python

นิยามและอัตราส่วนของชุดข้อมูล

ชุดข้อมูล ความหมาย
Train ข้อมูลตัวอย่างที่ใช้ในการ fit โมเดล
Test (holdout sample) ข้อมูลตัวอย่างที่ใช้ประเมินประสิทธิภาพของโมเดล

ตัวอย่างอัตราส่วน

  • 80:20
  • 90:10 (ใช้เมื่อข้อมูลมีน้อย)
  • 70:30 (ใช้เมื่อโมเดลต้องการทรัพยากรการคำนวณสูง)
การตรวจสอบความถูกต้องของโมเดลใน Python

ชุดข้อมูล X และ y

import pandas as pd

tic_tac_toe = pd.read_csv("tic-tac-toe.csv")
X = pd.get_dummies(tic_tac_toe.iloc[:,0:9])
y = tic_tac_toe.iloc[:, 9]

คอร์ส Python ที่ครอบคลุมเรื่อง dummy variables:

การตรวจสอบความถูกต้องของโมเดลใน Python

การสร้าง holdout samples

X_train, X_test, y_train, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)

พารามิเตอร์:

  • test_size
  • train_size
  • random_state
การตรวจสอบความถูกต้องของโมเดลใน Python

ชุดข้อมูลสำหรับการทดสอบเบื้องต้น?

จะทำอย่างไรเมื่อต้องทดสอบพารามิเตอร์ของโมเดลต่างๆ?

  • ต้นไม้ 100 versus 1000 ต้น
การตรวจสอบความถูกต้องของโมเดลใน Python

ในการทดสอบพารามิเตอร์โมเดล ต้องแบ่งข้อมูลออกเป็น 3 ส่วน ได้แก่ training, validation และ testing

การตรวจสอบความถูกต้องของโมเดลใน Python

Train, validation, test (ต่อ)

X_temp, X_test, y_temp, y_test  =\
    train_test_split(X, y, test_size=0.2, random_state=1111)
X_train, X_val, y_train, y_val =\
    train_test_split(X_temp, y_temp, test_size=0.25, random_state=11111)
การตรวจสอบความถูกต้องของโมเดลใน Python

มาฝึกกันเถอะ!

การตรวจสอบความถูกต้องของโมเดลใน Python

Preparing Video For Download...