Come si legge un intervallo di confidenza

Un intervallo di confidenza al 95% è costruito con un metodo che, ripetuto su molti campioni, contiene la media vera della popolazione nel 95% dei casi. La simulazione qui sopra lo mostra: ogni riga è un campione diverso e, di solito, uno su venti manca il bersaglio.

L'ampiezza dipende da tre cose: la variabilità dei dati, misurata dalla deviazione standard; il numero di osservazioni, perché l'errore standard è σ/√n; il livello di confidenza, perché chiedere più sicurezza allarga l'intervallo. Per dimezzare il margine d'errore servono quattro volte le osservazioni.

Esempio: 40 studenti alti in media 172,5 cm con deviazione standard 7,2 cm. L'errore standard è 7,2/√40 ≈ 1,14 cm, il valore t per 39 gradi di libertà è circa 2,02 e l'intervallo al 95% va da circa 170,2 a 174,8 cm.

Errori frequenti

  • Dire che c'è il 95% di probabilità che la media sia nell'intervallo calcolato: la media è fissa, è l'intervallo che varia da campione a campione.
  • Usare z con campioni piccoli e deviazione standard stimata: l'intervallo risulta troppo stretto.
  • Pensare che il 95% delle osservazioni cada nell'intervallo: riguarda la media, non i singoli valori.

Domande frequenti

Che differenza c'è fra 95% e 99%?

Al 99% l'intervallo è più largo: per essere più sicuri di catturare la media bisogna accettare un intervallo meno preciso.

Quante osservazioni servono?

Il margine d'errore scende come 1/√n: per un margine di E servono circa (z·σ/E)² osservazioni.

Quando usare la t di Student?

Quando la deviazione standard è calcolata dagli stessi dati, cioè quasi sempre. Oltre un centinaio di osservazioni t e z danno praticamente lo stesso risultato.

Come funziona questo calcolo

Intervallo = x̄ ± c · s/√n, dove c è il quantile 1 − (1 − livello)/2 della normale (z) o della t di Student con n − 1 gradi di libertà. La simulazione estrae campioni di n valori da una normale e ricalcola ogni volta l'intervallo con lo stesso metodo.