Jak czytać przedział ufności

Przedział ufności 95% powstaje metodą, która powtarzana na wielu próbach zawiera prawdziwą średnią populacji w 95% przypadków. Pokazuje to symulacja powyżej: każdy wiersz to inna próba i zwykle jeden na dwadzieścia chybia.

Jego szerokość zależy od trzech rzeczy: zmienności danych, mierzonej odchyleniem standardowym; liczby obserwacji, bo błąd standardowy to σ/√n; oraz poziomu ufności, bo większa pewność poszerza przedział. Aby zmniejszyć margines błędu o połowę, trzeba czterokrotnie więcej obserwacji.

Przykład: 40 studentów o średnim wzroście 172,5 cm i odchyleniu standardowym 7,2 cm. Błąd standardowy to 7,2/√40 ≈ 1,14 cm, wartość t dla 39 stopni swobody to około 2,02, a przedział 95% sięga od około 170,2 do 174,8 cm.

Częste błędy

  • Mówienie, że średnia z 95% prawdopodobieństwem leży w obliczonym przedziale: średnia jest stała, to przedział zmienia się z próby na próbę.
  • Używanie z przy małych próbach i szacowanym odchyleniu: przedział wychodzi zbyt wąski.
  • Przekonanie, że 95% obserwacji mieści się w przedziale: dotyczy on średniej, nie pojedynczych wartości.

Najczęstsze pytania

Czym różni się 95% od 99%?

Przy 99% przedział jest szerszy: aby mieć większą pewność, że obejmuje średnią, trzeba przyjąć mniejszą precyzję.

Ile obserwacji potrzebuję?

Margines błędu maleje jak 1/√n: dla marginesu E potrzeba około (z·σ/E)² obserwacji.

Kiedy stosować rozkład t-Studenta?

Gdy odchylenie standardowe liczy się z tych samych danych, czyli prawie zawsze. Powyżej około stu obserwacji t i z dają praktycznie ten sam wynik.

Jak działa to obliczenie

Przedział = x̄ ± c · s/√n, gdzie c to kwantyl 1 − (1 − poziom)/2 rozkładu normalnego (z) lub t-Studenta z n − 1 stopniami swobody. Symulacja losuje próby n wartości z rozkładu normalnego i za każdym razem buduje przedział tą samą metodą.