O Alicerce da Ciência de Dados: Processo Gerador dos Dados

Tutorial sobre o processo gerador dos dados (PGD): o que é, por que importa para inferências e previsões válidas, e como identificar a distribuição de uma variável no Python, com simulação reproduzível e comparação formal entre candidatas.

O processo gerador dos dados (PGD) é o mecanismo que produziu os números que você observa — e é ele que fundamenta a diferença entre uma suposição defensável e um palpite. Neste tutorial, explicamos o que é o PGD e mostramos, no Python, como investigar qual distribuição de probabilidade uma variável segue.

O erro que o conceito previne não avisa quando acontece: assumir normalidade para qualquer variável, estimar e reportar produz código que roda sem aviso — e inferências inválidas que só se revelam quando as previsões erram.

Histograma de uma variável simulada com a curva da distribuição normal sobreposta
A distribuição empírica de 1.984 observações simuladas contra a densidade teórica da normal. Fonte: simulação com semente fixa (numpy seed 1984).

O exercício parte de uma variável cujo PGD é conhecido (sorteada de uma normal com semente fixa) e verifica se os métodos de identificação a reencontram. É o cenário controlado que permite avaliar as ferramentas antes de aplicá-las a dados reais, onde a resposta não existe de antemão.

Código do exercício

O código com a identificação da distribuição que descreve seus dados, com a comparação entre candidatas está disponível em:

Acessar o código →

O que é o processo gerador dos dados

Uma analogia: imagine uma caixa de peças de Lego acompanhada de um manual de instruções. As peças são os dados observados; o manual é o PGD — a regra que diz como as peças se combinam. Quem monta sem conhecer o manual pode produzir algo, mas dificilmente o castelo pretendido.

Formalmente, o PGD é o processo ou mecanismo que gera os dados usados na análise. Pode ser físico (a medição de uma temperatura), comportamental (decisões de compra) ou institucional (a regra de cálculo de um índice de preços). Conhecê-lo orienta as suposições, a escolha do modelo e a leitura dos resultados.

O conhecimento perfeito é quase sempre impossível: observa-se uma amostra, não a população, e fatores não observados afetam a distribuição. O trabalho prático é aproximar — supor uma distribuição e verificar se a distribuição empírica dos dados é compatível. Em alguns casos a teoria sustenta a suposição: alturas aproximam a normal, contagens de eventos raros aproximam a Poisson, tempos de espera aproximam a exponencial. Nos demais, é preciso investigar nos próprios dados.

As quatro ferramentas de identificação

📊

Histograma
Mostra o formato geral: simetria, caudas, concentração.

📦

Boxplot
Destaca mediana, quartis e valores extremos; detecta assimetria.

📐

Gráfico Q-Q
Compara os quantis da variável com os de uma distribuição teórica.

🧪

Testes formais
Shapiro-Wilk, Kolmogorov-Smirnov e Anderson-Darling quantificam a aderência.

Nenhum instrumento decide sozinho: os gráficos revelam o formato e os testes quantificam a evidência. A prática combina os dois.

Gráfico quantil-quantil da variável simulada com os pontos alinhados sobre a reta da normal
Quantis observados contra os teóricos da normal; pontos sobre a reta indicam compatibilidade. Fonte: simulação com semente fixa (numpy seed 1984).

No gráfico quantil-quantil da variável simulada, os pontos acompanham a reta do começo ao fim, com desvios pequenos apenas nas caudas — onde há poucas observações e alguma oscilação é esperada.

A busca automática com o distfit

Histograma da variável com as cinco melhores distribuições ajustadas pelo distfit, praticamente sobrepostas
As cinco candidatas mais bem ajustadas pelo distfit, com escores quase idênticos. Fonte: simulação com semente fixa (numpy seed 1984).

A biblioteca distfit ajusta dezenas de candidatas por máxima verossimilhança e as ordena pela qualidade do ajuste. O resultado do exercício merece leitura cuidadosa: a gamma aparece em primeiro e a normal (o PGD verdadeiro) em quarto, com escores praticamente idênticos.

O empate ensina como o método funciona: com parâmetro de forma muito alto, a gamma imita uma normal quase perfeitamente, e o acaso da amostra decide o ranking por diferenças em casas decimais distantes. Quando os escores empatam assim, decidem a parcimônia e o conhecimento do fenômeno — não a métrica.

A comparação formal entre candidatas

Histograma da variável com as densidades ajustadas da normal, logística e Cauchy sobrepostas
As três candidatas ajustadas por máxima verossimilhança sobre os mesmos dados. Fonte: simulação com semente fixa (numpy seed 1984).

O passo final ajusta cada candidata por máxima verossimilhança e compara pelo AIC, critério que penaliza a verossimilhança pelo número de parâmetros — quanto menor, melhor:

Distribuição AIC
Normal 5.636
Logística 5.669
Cauchy 6.346

A normal vence com folga sobre a Cauchy, de caudas muito pesadas, e com margem clara sobre a logística, de formato parecido. O método reencontrou o PGD verdadeiro — que era o teste do exercício.

O que o resultado revela

  • A investigação reencontrou o PGD conhecido. Histograma, Q-Q e comparação formal convergiram para a normal que gerou os dados — a validação que autoriza usar as mesmas ferramentas em dados reais.
  • Métricas de ajuste podem empatar. Distribuições flexíveis imitam a normal com parâmetros extremos, e o ranking por escore vira loteria na margem. Parcimônia e teoria desempatam.
  • Nem todo método exige acertar a distribuição. Árvores de decisão e redes neurais aprendem sem suposições distribucionais explícitas — mas conhecer o PGD segue orientando transformações e leitura de erros.
  • Reprodutibilidade começa na semente. Sem semente fixa, cada execução produz números diferentes dos publicados.

Veja o exercício rodando em vídeo

A aula abaixo percorre as mesmas etapas deste guia, com o código rodando na tela.

A identificação da distribuição que descreve os dados, com a comparação entre as candidatas.

Considerações finais

O PGD é a regra por trás dos números, e aproximá-lo bem é condição para inferências e previsões válidas. O exercício mostra o caminho completo no Python: os gráficos para o formato, a varredura automática do distfit e a comparação por AIC para a decisão formal.

  • Analistas de dados: verificar a distribuição antes de modelar evita intervalos de confiança inválidos e previsões com viés.
  • Economistas: retornos, rendas e durações raramente são normais, e a escolha da distribuição muda a política estimada.
  • Profissionais de mercado financeiro: subestimar caudas pesadas é subestimar risco — a diferença entre a normal e uma t de Student aparece exatamente nos eventos extremos.
  • Pesquisadores e estudantes: a suposição distribucional é premissa de quase todo teste estatístico, e explicitá-la fortalece o trabalho.

Em todas elas o passo é o mesmo: identificar a distribuição que descreve os dados antes de escolher o modelo que os usa.

Você viu o alicerce; aprenda o método completo

Do processo gerador dos dados à modelagem de dados econômicos e financeiros, com Python aplicado a dados reais desde a primeira aula. Quem quer acesso a todas as formações tem o AM Black, a assinatura anual.

Conheça a formação →Ver o AM Black →

Leia também:

 

Compartilhe esse artigo

Facebook
Twitter
LinkedIn
WhatsApp
Telegram
Email
Print
Análise Macro © 2011 / 2026

comercial@analisemacro.com.br – Rua Visconde de Pirajá, 414, Sala 718
Ipanema, Rio de Janeiro – RJ – CEP: 22410-002

como podemos ajudar?

Preencha os seus dados abaixo e fale conosco no WhatsApp