Este artigo apresenta uma análise detalhada dos maiores salários de contratação no Brasil em 2025, com foco nos estados do Sudeste. Utilizando a linguagem Python, o estudo detalha a construção de um pipeline de engenharia de dados para processar milhões de microdados do Novo CAGED, desde a coleta via FTP até a agregação e armazenamento em formato Parquet. A metodologia inclui a aplicação de filtros estatísticos e o cálculo da mediana salarial para ranquear as 15 ocupações mais bem remuneradas.
Quem entra num emprego formal no Brasil ganha, na média, menos do que quem sai. Com os microdados do Novo CAGED e Python, este tutorial mostra como medir o gap salarial entre admitidos e demitidos: coleta dos dados, deflacionamento pelo INPC e ajuste sazonal com o X-13ARIMA-SEATS.
Neste exercício, investigamos a influência do trimestre de nascimento como um possível determinante dos rendimentos efetivos no Brasil. Pessoas nascidas em determinados trimestres tendem a acumular mais anos de estudo. Com base em uma observação empírica, utilizamos o trimestre de nascimento como uma variável instrumental para os anos de estudo em um modelo de Regressão Linear com Variáveis Instrumentais (IV). O objetivo é avaliar como essa relação afeta os rendimentos. Usamos a linguagem de programação R para a coleta, tratamento e análise de dados.
Os microdados dos CAGED fornecem informações detalhadas a nível de cidade, sexo, raça, nível de instrução, idade, salário e outras sobre os trabalhadores formais do Brasil, possibilitando ricas análises regionais de dados. Neste artigo mostramos como acessar, processar e analisar estes dados utilizando o Python.
Análises de dados no Excel são limitadas a 1 milhão de linhas, o que é um grande problema numa era de Big Data. Para superar este desafio, o Python oferece diversos pacotes que lidam com grandes volumes de dados e análises complexas. Neste artigo mostramos como superar esta limitação com um exemplo prático usando dados do IBGE.