Relativní chyba bodových odhadů

Vzorkování v Pythonu

James Chapman

Curriculum Manager, DataCamp

Velikost vzorku = počet řádků

len(coffee_ratings.sample(n=300))
300
len(coffee_ratings.sample(frac=0.25))
334
Vzorkování v Pythonu

Různé velikosti vzorků

coffee_ratings['total_cup_points'].mean()
82.15120328849028
coffee_ratings.sample(n=10)['total_cup_points'].mean()
83.027
coffee_ratings.sample(n=100)['total_cup_points'].mean()
82.4897
coffee_ratings.sample(n=1000)['total_cup_points'].mean()
82.1186
Vzorkování v Pythonu

Relativní chyby

Parametr populace:

population_mean = coffee_ratings['total_cup_points'].mean()

Bodový odhad:

sample_mean = coffee_ratings.sample(n=sample_size)['total_cup_points'].mean()

Relativní chyba v procentech:

rel_error_pct = 100 * abs(population_mean-sample_mean) / population_mean
Vzorkování v Pythonu

Relativní chyba vs. velikost vzorku

import matplotlib.pyplot as plt
errors.plot(x="sample_size", 
            y="relative_error", 
            kind="line")
plt.show()

Vlastnosti:

  • Výrazně zašuměné, zejména u malých vzorků
  • Amplituda zpočátku strmě klesá, poté se zplošťuje
  • Relativní chyba klesá k nule (při velikosti vzorku = populace)

Spojnicový graf relativní chyby v závislosti na velikosti vzorku.

Vzorkování v Pythonu

Pojďme procvičovat!

Vzorkování v Pythonu

Preparing Video For Download...