O coeficiente de correlação mede o quanto duas variáveis se movem na mesma direção. Ele responde se elas andam juntas, e para por aí: a mesma correlação pode nascer de uma causa direta, de um fator externo que move as duas, ou de pura coincidência.
As três explicações possíveis para uma associação, o que o coeficiente mede e um caso em que a correlação inverte de sinal: percorremos cada ponto com dados reais em R.
O que o coeficiente mede
O coeficiente de Pearson compara como as duas variáveis se afastam de suas médias. Quando as duas estão acima da média ao mesmo tempo, o produto dos desvios é positivo e empurra o coeficiente para cima.
O denominador normaliza o resultado para o intervalo de −1 a 1. O valor 1 indica que os pontos caem exatamente sobre uma reta crescente, −1 sobre uma reta decrescente, e 0 que não existe relação linear entre as variáveis.
Duas limitações vêm da própria fórmula. Ela capta apenas relação linear, e uma associação em forma de U pode produzir correlação próxima de zero. E o coeficiente é simétrico: a correlação de X com Y é idêntica à de Y com X, o que já mostra que ele não distingue causa de efeito.
As três explicações para a mesma associação
Encontrar correlação entre duas variáveis deixa pelo menos três cenários em aberto, e os dados sozinhos não escolhem entre eles.

Na causa direta, a mudança em X produz a mudança em Y. Aumentar a taxa de juros reduz o crédito concedido, e a relação tem mecanismo econômico conhecido.
Na causa comum, um terceiro fator move as duas variáveis. A venda de sorvete e os afogamentos crescem juntos porque ambos aumentam no verão, e um não provoca o outro. Esse terceiro fator se chama variável de confusão.
Na coincidência, duas séries sobem ao mesmo tempo sem qualquer ligação. Com séries longas e muitas variáveis candidatas, correlações altas aparecem por acaso, e é o que as correlações espúrias exploram.
Os dados: pinguins do arquipélago Palmer
Usaremos medidas de 342 pinguins de três espécies, coletadas na Antártida. A base traz comprimento e profundidade do bico, comprimento da nadadeira e massa corporal.
library(dplyr) # manipulação de dados
library(tidyr) # tratamento de valores ausentes
library(palmerpenguins) # traz o conjunto dos pinguins
pinguins <- penguins |>
drop_na(bill_length_mm, bill_depth_mm, body_mass_g) # remove medidas faltantes
cor(pinguins$bill_length_mm, pinguins$body_mass_g) # bico e massa corporal
A correlação entre comprimento do bico e massa corporal é de 0,60, uma associação moderada e positiva: pinguins de bico mais longo tendem a ser mais pesados. Nada surpreendente, já que ambas as medidas acompanham o tamanho do animal.
📩 Acompanhe nossas análises
O Boletim AM traz análises de conjuntura, exercícios em R e Python e material de estudo, direto no seu e-mail.
Quando a correlação inverte de sinal
O caso interessante aparece entre comprimento e profundidade do bico. Calculando sobre os 342 pinguins juntos, o coeficiente é de −0,24: bicos mais longos seriam menos profundos.
# A correlação no conjunto inteiro
cor(pinguins$bill_length_mm, pinguins$bill_depth_mm)
# A mesma correlação, calculada dentro de cada espécie
pinguins |>
group_by(species) |> # separa por espécie
summarise(
n = n(), # quantos pinguins
r = round(cor(bill_length_mm, bill_depth_mm), 3) # a correlação no grupo
)
| Recorte | Pinguins | Correlação |
|---|---|---|
| Todos juntos | 342 | −0,24 |
| Adelie | 151 | +0,39 |
| Chinstrap | 68 | +0,65 |
| Gentoo | 123 | +0,64 |

Dentro de cada espécie a correlação é positiva, entre +0,39 e +0,65. O sinal se inverte quando juntamos os grupos, e esse fenômeno se chama paradoxo de Simpson.
A explicação está na espécie. Os Gentoo têm bico longo e raso; os Adelie, bico curto e profundo. Essa diferença entre espécies domina o cálculo conjunto e produz a inclinação negativa, enquanto a relação real, dentro de cada grupo, vai no sentido oposto.
A espécie é a variável de confusão deste exemplo. Ignorá-la não produz apenas uma estimativa imprecisa: produz uma conclusão de sinal trocado.
O que permite falar em causa
O experimento aleatorizado é o caminho mais direto. Sortear quem recebe o tratamento garante que os grupos se diferenciem apenas pela intervenção, o que elimina as variáveis de confusão por construção. É o princípio do teste A/B.
Quando o experimento é inviável, os métodos de inferência causal exploram situações que se aproximam dele. Diferenças em diferenças, variáveis instrumentais e regressão com descontinuidade buscam variação que não dependa das características dos envolvidos.
O passo mínimo, em qualquer análise observacional, é listar as variáveis de confusão plausíveis e verificar se a associação sobrevive ao controle por elas. Nos pinguins, bastou separar por espécie.
Onde a confusão entre os dois custa caro
Em avaliação de política pública, comparar quem aderiu a um programa com quem não aderiu mistura o efeito do programa com as características de quem decidiu participar.
Em marketing, clientes que recebem uma campanha costumam ser os que já compravam mais. A diferença de vendas depois dela reflete a seleção, e não só o efeito da campanha.
Em análise de crédito, um modelo pode associar uma região a maior inadimplência quando o que explica o risco é a renda dos moradores. Decidir pela região penaliza quem mora lá e tem bom perfil.
Em saúde e economia, séries temporais longas produzem correlações altas entre variáveis sem relação, porque ambas crescem com a população ou com a renda ao longo do tempo.
Considerações finais
O coeficiente de correlação responde uma pergunta estreita e bem definida: as duas variáveis se movem juntas, em relação linear. Atribuir causa exige argumento de fora dos dados, seja o desenho experimental, seja o conhecimento do mecanismo.
No nosso exemplo, a correlação entre comprimento e profundidade do bico passou de −0,24 para valores entre +0,39 e +0,65 quando separamos as espécies. O mesmo dado, dois sinais opostos, conforme o recorte.
Reconhecer esse limite muda o trabalho conforme a área:
- Analista de dados: investiga variáveis de confusão antes de apresentar uma associação como descoberta.
- Economista: escolhe o método de identificação adequado quando o experimento é inviável.
- Profissional de marketing: estima o efeito da campanha descontando o perfil de quem a recebeu.
- Cientista de dados: distingue variável preditiva de variável causal ao interpretar um modelo.
- Gestor: pergunta pelo mecanismo antes de agir sobre uma correlação apresentada em relatório.
Da associação à causa
Medir correlação é o primeiro passo; identificar efeito causal exige método. O AM Black é a assinatura anual que dá acesso a todos os cursos da Análise Macro, em R e em Python, da estatística básica à econometria aplicada.