Como ler estas medidas

A estatística descritiva resume um conjunto de dados em poucas medidas, que se dividem em duas famílias. As medidas de posição dizem onde está o centro: média, mediana e moda. As medidas de dispersão dizem o quanto os valores se afastam desse centro: amplitude, variância, desvio padrão e amplitude interquartil. Você precisa das duas, porque dois conjuntos com a mesma média podem ter formas completamente diferentes.

Média e mediana respondem à mesma pergunta de jeitos diferentes. A média soma todos os valores e divide pela quantidade, então é puxada pelos valores extremos: um único salário muito alto desloca a média de um escritório. A mediana é o valor do meio depois de ordenar os dados, e um valor atípico não a move. Quando média e mediana diferem muito, a distribuição é assimétrica e é a mediana que descreve melhor o caso típico.

O desvio padrão é a raiz quadrada da variância e tem a vantagem de ficar na mesma unidade dos dados. Há duas versões: a populacional divide por n e é usada quando os dados são todo o grupo de interesse; a amostral divide por n − 1 (correção de Bessel) e é usada quando os dados são uma amostra de uma população maior. A segunda é um pouco maior, porque corrige a tendência de uma amostra a subestimar a variabilidade real.

Exemplo com os dados 12, 15, 15, 18, 21, 24, 24, 24, 30: a soma é 183 em 9 valores, então a média é 20,33. Ordenados, o valor do meio é o quinto, 21: essa é a mediana. O 24 aparece três vezes e é a moda. O desvio padrão populacional é 5,52, o amostral 5,85. O primeiro quartil é 15 e o terceiro 24, então metade dos dados fica entre esses dois valores.

Erros frequentes

  • Usar o desvio padrão amostral para dados que representam toda a população, ou o contrário: a diferença é desprezível em conjuntos grandes, mas visível abaixo de umas trinta observações.
  • Descrever uma distribuição muito assimétrica, como a de rendas, só pela média: a mediana diz muito mais sobre o caso típico.
  • Confundir ausência de moda com várias modas: se todos os valores aparecem o mesmo número de vezes não há moda, enquanto dois valores empatados na maior frequência dão uma distribuição bimodal.
  • Comparar desvios padrão de grandezas com unidades ou ordens de grandeza diferentes: é para isso que serve o coeficiente de variação, que relaciona a dispersão à média.
  • Esquecer que os quartis podem ser calculados com convenções diferentes: esta página usa interpolação linear, como as planilhas, e outros livros podem dar valores um pouco diferentes.

Perguntas frequentes

Qual a diferença entre média, mediana e moda?

A média é a soma dos valores dividida pela quantidade. A mediana é o valor do meio dos dados ordenados, ou a média dos dois do meio se a quantidade for par. A moda é o valor que aparece mais vezes. Em uma distribuição simétrica elas quase coincidem; em uma assimétrica se separam.

Devo usar o desvio padrão populacional ou o amostral?

Se os dados são o grupo inteiro que interessa — as notas de uma turma inteira —, use o populacional, que divide por n. Se são uma amostra da qual você quer tirar conclusões sobre um grupo maior, use o amostral, que divide por n − 1.

O que o coeficiente de variação diz?

É a razão entre o desvio padrão e a média, em porcentagem. Permite comparar a dispersão de grandezas diferentes: uma variabilidade de 5 em torno de uma média de 10 pesa muito mais do que a mesma variabilidade em torno de uma média de 1.000.

Como se calculam os quartis?

Q1 deixa abaixo de si um quarto dos dados ordenados, Q3 três quartos. Esta calculadora os obtém por interpolação linear entre os valores vizinhos da posição teórica, a mesma convenção das planilhas. A diferença Q3 − Q1 é a amplitude interquartil.

Em que formato devem estar os dados?

No que você preferir: separados por espaços, vírgulas, ponto e vírgula ou quebras de linha. Você pode colar uma coluna copiada direto do Excel ou de um CSV. A vírgula é tratada como separador entre valores, então use o ponto para os decimais.

Como funciona este cálculo

Média: x̄ = Σxᵢ / n. Mediana: o valor na posição (n + 1) / 2 dos dados ordenados, interpolado quando essa posição não é inteira. Variância populacional: σ² = Σ(xᵢ − x̄)² / n; variância amostral: s² = Σ(xᵢ − x̄)² / (n − 1). O desvio padrão é a raiz quadrada da respectiva variância. Os quartis são tomados na posição p × (n − 1) com interpolação linear entre valores vizinhos. Coeficiente de variação = σ / |x̄| × 100.