O que é Teste de Hipóteses

Tutorial sobre o que é teste de hipóteses e como construí-lo no R com o pacote infer, montando a distribuição nula por permutação em vez de fórmula. O exercício usa um experimento real de discriminação em promoções e mostra por que ‘não rejeitar’ não é o mesmo que ‘aceitar’.


O coeficiente de correlação mede o quanto duas variáveis se movem na mesma direção. Ele responde se elas andam juntas, e para por aí: a mesma correlação pode nascer de uma causa direta, de um fator externo que move as duas, ou de pura coincidência.

As três explicações possíveis para uma associação, o que o coeficiente mede e um caso em que a correlação inverte de sinal: percorremos cada ponto com dados reais em R.

O que o coeficiente mede

O coeficiente de Pearson compara como as duas variáveis se afastam de suas médias. Quando as duas estão acima da média ao mesmo tempo, o produto dos desvios é positivo e empurra o coeficiente para cima.

r = nΣi=1(xi − x̄)(yi − ȳ)√Σ(xi − x̄)2 Σ(yi − ȳ)2

O denominador normaliza o resultado para o intervalo de −1 a 1. O valor 1 indica que os pontos caem exatamente sobre uma reta crescente, −1 sobre uma reta decrescente, e 0 que não existe relação linear entre as variáveis.

Duas limitações vêm da própria fórmula. Ela capta apenas relação linear, e uma associação em forma de U pode produzir correlação próxima de zero. E o coeficiente é simétrico: a correlação de X com Y é idêntica à de Y com X, o que já mostra que ele não distingue causa de efeito.

As três explicações para a mesma associação

Encontrar correlação entre duas variáveis deixa pelo menos três cenários em aberto, e os dados sozinhos não escolhem entre eles.

Três diagramas: causa direta de X para Y, causa comum em que Z provoca X e Y, e coincidência sem relação entre as variáveis
A mesma correlação observada é compatível com os três casos.

Na causa direta, a mudança em X produz a mudança em Y. Aumentar a taxa de juros reduz o crédito concedido, e a relação tem mecanismo econômico conhecido.

Na causa comum, um terceiro fator move as duas variáveis. A venda de sorvete e os afogamentos crescem juntos porque ambos aumentam no verão, e um não provoca o outro. Esse terceiro fator se chama variável de confusão.

Na coincidência, duas séries sobem ao mesmo tempo sem qualquer ligação. Com séries longas e muitas variáveis candidatas, correlações altas aparecem por acaso, e é o que as correlações espúrias exploram.

Os dados: pinguins do arquipélago Palmer

Usaremos medidas de 342 pinguins de três espécies, coletadas na Antártida. A base traz comprimento e profundidade do bico, comprimento da nadadeira e massa corporal.

library(dplyr)            # manipulação de dados
library(tidyr)            # tratamento de valores ausentes
library(palmerpenguins)   # traz o conjunto dos pinguins

pinguins <- penguins |>
  drop_na(bill_length_mm, bill_depth_mm, body_mass_g)   # remove medidas faltantes

cor(pinguins$bill_length_mm, pinguins$body_mass_g)      # bico e massa corporal

A correlação entre comprimento do bico e massa corporal é de 0,60, uma associação moderada e positiva: pinguins de bico mais longo tendem a ser mais pesados. Nada surpreendente, já que ambas as medidas acompanham o tamanho do animal.

📩 Acompanhe nossas análises

O Boletim AM traz análises de conjuntura, exercícios em R e Python e material de estudo, direto no seu e-mail.

Assinar o Boletim AM →

Quando a correlação inverte de sinal

O caso interessante aparece entre comprimento e profundidade do bico. Calculando sobre os 342 pinguins juntos, o coeficiente é de −0,24: bicos mais longos seriam menos profundos.

# A correlação no conjunto inteiro
cor(pinguins$bill_length_mm, pinguins$bill_depth_mm)

# A mesma correlação, calculada dentro de cada espécie
pinguins |>
  group_by(species) |>                              # separa por espécie
  summarise(
    n = n(),                                        # quantos pinguins
    r = round(cor(bill_length_mm, bill_depth_mm), 3)  # a correlação no grupo
  )
Recorte Pinguins Correlação
Todos juntos 342 −0,24
Adelie 151 +0,39
Chinstrap 68 +0,65
Gentoo 123 +0,64
Dois gráficos de dispersão: no conjunto completo a reta de tendência desce, e separando por espécie as três retas sobem
A correlação é negativa no conjunto e positiva dentro de cada uma das três espécies.

Dentro de cada espécie a correlação é positiva, entre +0,39 e +0,65. O sinal se inverte quando juntamos os grupos, e esse fenômeno se chama paradoxo de Simpson.

A explicação está na espécie. Os Gentoo têm bico longo e raso; os Adelie, bico curto e profundo. Essa diferença entre espécies domina o cálculo conjunto e produz a inclinação negativa, enquanto a relação real, dentro de cada grupo, vai no sentido oposto.

A espécie é a variável de confusão deste exemplo. Ignorá-la não produz apenas uma estimativa imprecisa: produz uma conclusão de sinal trocado.

O que permite falar em causa

O experimento aleatorizado é o caminho mais direto. Sortear quem recebe o tratamento garante que os grupos se diferenciem apenas pela intervenção, o que elimina as variáveis de confusão por construção. É o princípio do teste A/B.

Quando o experimento é inviável, os métodos de inferência causal exploram situações que se aproximam dele. Diferenças em diferenças, variáveis instrumentais e regressão com descontinuidade buscam variação que não dependa das características dos envolvidos.

O passo mínimo, em qualquer análise observacional, é listar as variáveis de confusão plausíveis e verificar se a associação sobrevive ao controle por elas. Nos pinguins, bastou separar por espécie.

Onde a confusão entre os dois custa caro

Em avaliação de política pública, comparar quem aderiu a um programa com quem não aderiu mistura o efeito do programa com as características de quem decidiu participar.

Em marketing, clientes que recebem uma campanha costumam ser os que já compravam mais. A diferença de vendas depois dela reflete a seleção, e não só o efeito da campanha.

Em análise de crédito, um modelo pode associar uma região a maior inadimplência quando o que explica o risco é a renda dos moradores. Decidir pela região penaliza quem mora lá e tem bom perfil.

Em saúde e economia, séries temporais longas produzem correlações altas entre variáveis sem relação, porque ambas crescem com a população ou com a renda ao longo do tempo.

Considerações finais

O coeficiente de correlação responde uma pergunta estreita e bem definida: as duas variáveis se movem juntas, em relação linear. Atribuir causa exige argumento de fora dos dados, seja o desenho experimental, seja o conhecimento do mecanismo.

No nosso exemplo, a correlação entre comprimento e profundidade do bico passou de −0,24 para valores entre +0,39 e +0,65 quando separamos as espécies. O mesmo dado, dois sinais opostos, conforme o recorte.

Reconhecer esse limite muda o trabalho conforme a área:

  • Analista de dados: investiga variáveis de confusão antes de apresentar uma associação como descoberta.
  • Economista: escolhe o método de identificação adequado quando o experimento é inviável.
  • Profissional de marketing: estima o efeito da campanha descontando o perfil de quem a recebeu.
  • Cientista de dados: distingue variável preditiva de variável causal ao interpretar um modelo.
  • Gestor: pergunta pelo mecanismo antes de agir sobre uma correlação apresentada em relatório.

Da associação à causa

Medir correlação é o primeiro passo; identificar efeito causal exige método. O AM Black é a assinatura anual que dá acesso a todos os cursos da Análise Macro, em R e em Python, da estatística básica à econometria aplicada.

Conhecer o AM Black →

Compartilhe esse artigo

Facebook
Twitter
LinkedIn
WhatsApp
Telegram
Email
Print
Análise Macro © 2011 / 2026

comercial@analisemacro.com.br – Rua Visconde de Pirajá, 414, Sala 718
Ipanema, Rio de Janeiro – RJ – CEP: 22410-002

como podemos ajudar?

Preencha os seus dados abaixo e fale conosco no WhatsApp