การสุ่มตัวอย่างและค่าประมาณจุด

การสุ่มตัวอย่างใน Python

James Chapman

Curriculum Manager, DataCamp

การประมาณจำนวนประชากรของฝรั่งเศส

แผนที่ประเทศฝรั่งเศส

การสำรวจสำมะโนประชากรจะถามทุกครัวเรือนว่ามีคนอาศัยอยู่กี่คน

การสุ่มตัวอย่างใน Python

ฝรั่งเศสมีประชากรจำนวนมาก

แผนที่ประเทศฝรั่งเศสพร้อมไอคอนคน

การสำรวจสำมะโนประชากรมีค่าใช้จ่ายสูงมาก!

การสุ่มตัวอย่างใน Python

การสุ่มตัวอย่างครัวเรือน

แผนที่ประเทศฝรั่งเศสพร้อมไอคอนคน โดยบางคนถูกไฮไลต์ไว้

ประหยัดกว่าถ้าสอบถามครัวเรือนเพียงบางส่วน แล้วใช้สถิติประมาณจำนวนประชากร

การทำงานกับข้อมูลส่วนหนึ่งของประชากรทั้งหมดเรียกว่า การสุ่มตัวอย่าง

การสุ่มตัวอย่างใน Python

ประชากร vs. ตัวอย่าง

ประชากร คือชุดข้อมูลทั้งหมด

  • ไม่จำเป็นต้องหมายถึงผู้คน
  • โดยทั่วไปแล้วไม่ทราบข้อมูลประชากรทั้งหมด

 

ตัวอย่าง คือข้อมูลส่วนหนึ่งที่นำมาคำนวณ

การสุ่มตัวอย่างใน Python

ชุดข้อมูลการให้คะแนนกาแฟ

total_cup_points variety country_of_origin aroma flavor aftertaste body balance
90.58 NA Ethiopia 8.67 8.83 8.67 8.50 8.42
89.92 Other Ethiopia 8.75 8.67 8.50 8.42 8.42
... ... ... ... ... ... ... ...
73.75 NA Vietnam 6.75 6.67 6.5 6.92 6.83

 

  • แต่ละแถวแทนกาแฟ 1 แก้ว
  • 1338 แถว
  • จะใช้ข้อมูลนี้เป็นประชากร
การสุ่มตัวอย่างใน Python

คะแนนรวม vs. รสชาติ: ประชากร

pts_vs_flavor_pop = coffee_ratings[["total_cup_points", "flavor"]]
      total_cup_points  flavor
0                90.58    8.83
1                89.92    8.67
2                89.75    8.50
3                89.00    8.58
4                88.83    8.50
...                ...     ...
1333             78.75    7.58
1334             78.08    7.67
1335             77.17    7.33
1336             75.08    6.83
1337             73.75    6.67

[1338 rows x 2 columns]
การสุ่มตัวอย่างใน Python

คะแนนรวม vs. รสชาติ: ตัวอย่าง 10 แถว

pts_vs_flavor_samp = pts_vs_flavor_pop.sample(n=10)
      total_cup_points  flavor
1088             80.33    7.17
1157             79.67    7.42
1267             76.17    7.33
506              83.00    7.67
659              82.50    7.42
817              81.92    7.50
1050             80.67    7.42
685              82.42    7.50
1027             80.92    7.25
62               85.58    8.17

[10 rows x 2 columns]
การสุ่มตัวอย่างใน Python

การสุ่มตัวอย่าง Series ใน Python

  • ใช้ .sample() กับ pandas DataFrames และ Series
cup_points_samp = coffee_ratings['total_cup_points'].sample(n=10)
1088    80.33
1157    79.67
1267    76.17
...     ... 
685     82.42
1027    80.92
62      85.58
Name: total_cup_points, dtype: float64
การสุ่มตัวอย่างใน Python

พารามิเตอร์ประชากร & ค่าประมาณจุด

พารามิเตอร์ประชากร คือค่าที่คำนวณจากชุดข้อมูลประชากรทั้งหมด

import numpy as np
np.mean(pts_vs_flavor_pop['total_cup_points'])
82.15120328849028

ค่าประมาณจุด หรือ สถิติตัวอย่าง คือค่าที่คำนวณจากชุดข้อมูลตัวอย่าง

np.mean(cup_points_samp)
81.31800000000001
การสุ่มตัวอย่างใน Python

ค่าประมาณจุดด้วย pandas

pts_vs_flavor_pop['flavor'].mean()
7.526046337817639
pts_vs_flavor_samp['flavor'].mean()
7.485000000000001
การสุ่มตัวอย่างใน Python

มาฝึกกันเถอะ!

การสุ่มตัวอย่างใน Python

Preparing Video For Download...