บทนำสู่การตรวจสอบโมเดล

การตรวจสอบความถูกต้องของโมเดลใน Python

Kasey Jones

Data Scientist

การตรวจสอบโมเดลคืออะไร?

การตรวจสอบโมเดลประกอบด้วย:

  • ตรวจสอบว่าโมเดลทำงานได้ตามคาดบนข้อมูลใหม่
  • ทดสอบประสิทธิภาพโมเดลบน holdout dataset
  • เลือกโมเดล พารามิเตอร์ และ accuracy metric ที่เหมาะสมที่สุด
  • ทำให้ได้ความแม่นยำสูงสุดสำหรับข้อมูลที่มี
การตรวจสอบความถูกต้องของโมเดลใน Python

ทบทวนการสร้างโมเดลด้วย scikit-learn

ขั้นตอนพื้นฐานของการสร้างโมเดล:

model = RandomForestRegressor(n_estimators=500, random_state=1111)

model.fit(X=X_train, y=y_train)
RandomForestRegressor(bootstrap=True, criterion='mse', max_depth=None,
           max_features='auto', max_leaf_nodes=None,
           min_impurity_decrease=0.0, min_impurity_split=None,
           min_samples_leaf=1, min_samples_split=2,
           min_weight_fraction_leaf=0.0, n_estimators=500, n_jobs=1,
           oob_score=False, random_state=1111, verbose=0, warm_start=False)
การตรวจสอบความถูกต้องของโมเดลใน Python

ทบทวนการสร้างโมเดล (ต่อ)

predictions = model.predict(X_test)

print("{0:.2f}".format(mae(y_true=y_test, y_pred=predictions)))
10.84

สูตร Mean Absolute Error

$$ \frac{\sum_{i=1}^{n} |y_i - \hat{y}_i|}{n} $$

การตรวจสอบความถูกต้องของโมเดลใน Python

ทบทวนความรู้พื้นฐาน

การตรวจสอบความถูกต้องของโมเดลใน Python

Fivethirtyeight มีชุดข้อมูลหลายชุด รวมถึงชุดข้อมูลจัดอันดับลูกอมฮาโลวีน โดยแต่ละลูกอมมีเปอร์เซ็นต์ชนะแบบตัวต่อตัวระหว่าง 0 ถึง 100%

การตรวจสอบความถูกต้องของโมเดลใน Python

ข้อมูลที่เคยเห็น vs. ข้อมูลที่ไม่เคยเห็น

ข้อมูล Training = ข้อมูลที่โมเดลเคยเห็น

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
train_predictions = model.predict(X_train)

ข้อมูล Testing = ข้อมูลที่โมเดลไม่เคยเห็น

model = RandomForestRegressor(n_estimators=500, random_state=1111)
model.fit(X_train, y_train)
test_predictions = model.predict(X_test)
การตรวจสอบความถูกต้องของโมเดลใน Python

มาเริ่มกันเลย!

การตรวจสอบความถูกต้องของโมเดลใน Python

Preparing Video For Download...