Uma distribuição de frequência organiza dados brutos e não ordenados em uma tabela que mostra a frequência com que cada valor — ou intervalo de valores — ocorre. É a primeira etapa em quase todos os fluxos de trabalho introdutórios de estatística, transformando uma parede de números em um resumo que você pode realmente ler, traçar e tirar conclusões.
Dados desagrupados vs. dados agrupados
As distribuições de frequência não agrupadas listam cada valor distinto no conjunto de dados juntamente com quantas vezes ele ocorre. Eles funcionam bem para pequenos conjuntos de dados ou dados com um número limitado de valores repetidos, como contar quantos alunos obtiveram cada nota possível em um teste de 10 pontos.
As distribuições de frequência agrupadas classificam os dados em intervalos de largura igual (classes), o que é essencial, uma vez que os dados abrangem uma ampla gama de valores, em sua maioria únicos, como pontuações de testes de 100, idades em uma população ou medições contínuas. O agrupamento troca alguma precisão (você perde o valor exato de cada ponto de dados) pela legibilidade.
Escolhendo o número de aulas
Poucas classes e a distribuição escondem detalhes úteis — tudo fica agrupado em uma ou duas barras. Muitas classes e a distribuição tornam-se ruidosas, com muitas classes contendo apenas um ou zero pontos de dados. A regra de Sturges (k = ⌈log₂(n) + 1⌉) e a regra √n (k = ⌈√n⌉) são dois pontos de partida amplamente ensinados, ambos os quais dimensionam a contagem de classes com o tamanho do conjunto de dados.
Nenhuma das regras é um requisito rígido - elas são heurísticas. Se o seu histograma parecer muito plano ou pontiagudo, ajuste a contagem de classes para cima ou para baixo e veja como a forma muda.
Leitura de frequência relativa e cumulativa
A frequência relativa (f/n) reformula a contagem de cada classe como uma parcela do todo, o que torna possível comparar conjuntos de dados de diferentes tamanhos. A frequência cumulativa rastreia um total acumulado pelas classes, respondendo a perguntas como "quantos pontos de dados estão nesse valor ou abaixo dele?" — a base para calcular percentis e quartis a partir de dados agrupados.
Limites e casos extremos
Agrupar dados em classes é um resumo, não um substituto para os dados brutos — uma vez agrupados, o valor exato de cada ponto de dados dentro de uma classe é perdido (é por isso que os pontos médios da classe são usados como uma aproximação para cálculos adicionais, como estimar a média de dados agrupados). Para conjuntos de dados muito pequenos (abaixo de aproximadamente 10 valores), considere usar o modo Desagrupado ou relatar os valores brutos diretamente, já que agrupar amostras pequenas pode ocultar mais do que revela.