O processo gerador dos dados (PGD) é o mecanismo que produziu os números que você observa — e é ele que fundamenta a diferença entre uma suposição defensável e um palpite. Neste tutorial, explicamos o que é o PGD e mostramos, no Python, como investigar qual distribuição de probabilidade uma variável segue.
O erro que o conceito previne não avisa quando acontece: assumir normalidade para qualquer variável, estimar e reportar produz código que roda sem aviso — e inferências inválidas que só se revelam quando as previsões erram.

O exercício parte de uma variável cujo PGD é conhecido (sorteada de uma normal com semente fixa) e verifica se os métodos de identificação a reencontram. É o cenário controlado que permite avaliar as ferramentas antes de aplicá-las a dados reais, onde a resposta não existe de antemão.
Código do exercício
O código com a identificação da distribuição que descreve seus dados, com a comparação entre candidatas está disponível em:
O que é o processo gerador dos dados
Uma analogia: imagine uma caixa de peças de Lego acompanhada de um manual de instruções. As peças são os dados observados; o manual é o PGD — a regra que diz como as peças se combinam. Quem monta sem conhecer o manual pode produzir algo, mas dificilmente o castelo pretendido.
Formalmente, o PGD é o processo ou mecanismo que gera os dados usados na análise. Pode ser físico (a medição de uma temperatura), comportamental (decisões de compra) ou institucional (a regra de cálculo de um índice de preços). Conhecê-lo orienta as suposições, a escolha do modelo e a leitura dos resultados.
O conhecimento perfeito é quase sempre impossível: observa-se uma amostra, não a população, e fatores não observados afetam a distribuição. O trabalho prático é aproximar — supor uma distribuição e verificar se a distribuição empírica dos dados é compatível. Em alguns casos a teoria sustenta a suposição: alturas aproximam a normal, contagens de eventos raros aproximam a Poisson, tempos de espera aproximam a exponencial. Nos demais, é preciso investigar nos próprios dados.
As quatro ferramentas de identificação
📊
📦
📐
🧪
Nenhum instrumento decide sozinho: os gráficos revelam o formato e os testes quantificam a evidência. A prática combina os dois.

No gráfico quantil-quantil da variável simulada, os pontos acompanham a reta do começo ao fim, com desvios pequenos apenas nas caudas — onde há poucas observações e alguma oscilação é esperada.
A busca automática com o distfit

A biblioteca distfit ajusta dezenas de candidatas por máxima verossimilhança e as ordena pela qualidade do ajuste. O resultado do exercício merece leitura cuidadosa: a gamma aparece em primeiro e a normal (o PGD verdadeiro) em quarto, com escores praticamente idênticos.
O empate ensina como o método funciona: com parâmetro de forma muito alto, a gamma imita uma normal quase perfeitamente, e o acaso da amostra decide o ranking por diferenças em casas decimais distantes. Quando os escores empatam assim, decidem a parcimônia e o conhecimento do fenômeno — não a métrica.
A comparação formal entre candidatas

O passo final ajusta cada candidata por máxima verossimilhança e compara pelo AIC, critério que penaliza a verossimilhança pelo número de parâmetros — quanto menor, melhor:
| Distribuição | AIC |
|---|---|
| Normal | 5.636 |
| Logística | 5.669 |
| Cauchy | 6.346 |
A normal vence com folga sobre a Cauchy, de caudas muito pesadas, e com margem clara sobre a logística, de formato parecido. O método reencontrou o PGD verdadeiro — que era o teste do exercício.
O que o resultado revela
- A investigação reencontrou o PGD conhecido. Histograma, Q-Q e comparação formal convergiram para a normal que gerou os dados — a validação que autoriza usar as mesmas ferramentas em dados reais.
- Métricas de ajuste podem empatar. Distribuições flexíveis imitam a normal com parâmetros extremos, e o ranking por escore vira loteria na margem. Parcimônia e teoria desempatam.
- Nem todo método exige acertar a distribuição. Árvores de decisão e redes neurais aprendem sem suposições distribucionais explícitas — mas conhecer o PGD segue orientando transformações e leitura de erros.
- Reprodutibilidade começa na semente. Sem semente fixa, cada execução produz números diferentes dos publicados.
Veja o exercício rodando em vídeo
A aula abaixo percorre as mesmas etapas deste guia, com o código rodando na tela.
Considerações finais
O PGD é a regra por trás dos números, e aproximá-lo bem é condição para inferências e previsões válidas. O exercício mostra o caminho completo no Python: os gráficos para o formato, a varredura automática do distfit e a comparação por AIC para a decisão formal.
- Analistas de dados: verificar a distribuição antes de modelar evita intervalos de confiança inválidos e previsões com viés.
- Economistas: retornos, rendas e durações raramente são normais, e a escolha da distribuição muda a política estimada.
- Profissionais de mercado financeiro: subestimar caudas pesadas é subestimar risco — a diferença entre a normal e uma t de Student aparece exatamente nos eventos extremos.
- Pesquisadores e estudantes: a suposição distribucional é premissa de quase todo teste estatístico, e explicitá-la fortalece o trabalho.
Em todas elas o passo é o mesmo: identificar a distribuição que descreve os dados antes de escolher o modelo que os usa.
Você viu o alicerce; aprenda o método completo
Do processo gerador dos dados à modelagem de dados econômicos e financeiros, com Python aplicado a dados reais desde a primeira aula. Quem quer acesso a todas as formações tem o AM Black, a assinatura anual.
Leia também: