Bootstrapping

พื้นฐานการอนุมานทางสถิติด้วย Python

Paul Savala

Assistant Professor of Mathematics

Bootstrapping

  • Bootstrapping = การสุ่มตัวอย่างแบบคืนค่า
    1. สุ่มเลือกตัวอย่าง
    2. บันทึกค่าที่ได้
    3. นำกลับเข้าข้อมูล (replacement)
    4. ทำซ้ำ
  • Bootstrapped sample = ตัวอย่างที่ได้จาก bootstrapping
พื้นฐานการอนุมานทางสถิติด้วย Python

ช่วงความเชื่อมั่นแบบ Non-parametric

  • แนวทาง non-parametric แทน stats.norm.interval
    • สุ่มตัวอย่างแบบคืนค่า
    • คำนวณค่าสถิติทดสอบ
    • บันทึกค่าที่ได้
    • ทำซ้ำ
  • สร้าง empirical distribution
พื้นฐานการอนุมานทางสถิติด้วย Python
salaries_df['Years of Employment']
[6, 11, 14, 3, 2, ...]
sample_1 = salaries_df['Years of Employment'].sample(n=10)

print(max(sample_1) - min(sample_1))
7
  • ทำซ้ำกระบวนการนี้หลายครั้ง
  • 95% ตรงกลางของผลลัพธ์ = ช่วงความเชื่อมั่น bootstrapped ที่ 95%
พื้นฐานการอนุมานทางสถิติด้วย Python
# Statistic function
def max_min(x):
    return max(x) - min(x)

# Data as a tuple data = (salaries_df['Years of Employment'], )
bootstrap_ci = stats.bootstrap(data, max_min, vectorized=False, n_resamples=1000)
print(bootstrap_ci)
BootstrapResult(confidence_interval=ConfidenceInterval(low=33.0, high=38.0),
standard_error=1.3843971812870597)
พื้นฐานการอนุมานทางสถิติด้วย Python

ช่วงความเชื่อมั่นแบบปกติ

 

  • ต้องการข้อมูลที่มีการแจกแจงแบบปกติ
  • คำนวณจากค่าเฉลี่ยและ standard error เท่านั้น
  • การอนุมานใช้ได้เฉพาะกับข้อมูลแบบปกติ
  • คำนวณได้รวดเร็วมาก

ช่วงความเชื่อมั่นแบบ Bootstrap

 

  • ใช้ได้กับการแจกแจงทุกรูปแบบ
  • คำนวณจากข้อมูลโดยตรงผ่านการ resampling
  • การอนุมานใช้ได้กับข้อมูลทุกประเภท
  • คำนวณช้ากว่ามาก
พื้นฐานการอนุมานทางสถิติด้วย Python

กรณีการใช้งาน Bootstrapping

  • เมื่อทำงานกับข้อมูลที่ไม่ใช่แบบปกติ
    • ข้อมูลแบบ rank
    • ข้อมูลที่มีความเบ้
  • เมื่อช่วงความเชื่อมั่นแบบปกติให้ค่าที่น่าสงสัย
  • ใช้ได้กับสถิติทดสอบได้ทุกประเภท
พื้นฐานการอนุมานทางสถิติด้วย Python

มาฝึกกันเถอะ!

พื้นฐานการอนุมานทางสถิติด้วย Python

Preparing Video For Download...