Hackeando o R: Análise de variáveis latentes

No Hackeando o R de hoje, vamos fazer uma expansão sobre o conteúdo do nosso post de semana passada, sobre análise de fatores. Dentro do contexto de fatores, a classificação com um único fator é equivalente ao clustering, e, considerando que as observações dentro de um mesmo cluster não são correlacionadas, entramos em um modelo chamado de análise de perfil latente. No post de hoje, consideraremos o caso em que as variáveis conhecidas são categóricas, chamado de análise de classes latentes. A ideia é podermos classificar indivíduos em grupos mutuamente exclusivos, a partir de suas respostas a perguntas categóricas. Nesse sentido, podemos ver que esse modelo é útil para a análise de dados de censos, como veremos no exemplo a seguir.

Para apresentarmos o modelo na prática, utilizaremos a base de dados do censo de instituições de saúde mental N-HMSS, disponível aqui. O modelo em si está disponível no pacote poLCA, logo iremos carregá-lo em conjunto com os dados abaixo:

library(poLCA)

seed = 1

data = read.csv('nmhss-puf-2019.csv')

No exemplo, vamos nos limitar aos tratamentos que estão disponíveis em cada instituição, identificados nas colunas 17 a 30. Além disso, precisamos fazer duas mudanças nos dados: números negativos querem dizer NA, e variáveis binárias precisam ser modificadas de 0 e 1 para 1 e 2 - uma limitação do pacote poLCA.

tratamento = data[, names(data)[17:30]]
tratamento[tratamento < 0] <- NA

tratamento <- tratamento + 1

summary(tratamento)

 

Para começar a análise, vamos procurar classes se baseando na oferta de 5 tratamentos: psicoterapia individual (TREATPSYCHOTHRPY), terapia familiar/de casal (TREATFAMTHRPY), terapia em grupo (TREATGRPTHRPY), terapia cognitivo-comportamental (TREATCOGTHRPY) e medicação psicotrópica (TREATPSYCHOMED).

A função poLCA requer 3 inputs: uma fórmula, um dataframe, e o número de classes a procurar. Abaixo, rodamos ela com 2 classes. O resultado é reportado automaticamente. Como podemos ver, para a primeira variável, temos que a probabilidade da segunda classe ser 2 é de 99.27%, ou seja, uma alta probabilidade de que há o tratamento, enquanto que a primeira classe apresenta apenas 33.72% de probabilidade de fornecer ele. Para todas as variáveis temos uma probabilidade maior para a classe 1 do que para a classe 2, indicando que a segunda classe abrange clínicas com maior variedade de tratamentos. Ademais, temos que é estimado que 88.33% das clínicas pertencem à segunda classe.

m <- poLCA(cbind(TREATPSYCHOTHRPY, TREATFAMTHRPY,
TREATGRPTHRPY, TREATCOGTHRPY,
TREATPSYCHOMED) ~ 1,
data = tratamento, nclass = 2)

Podemos visualizar o resultado de modo mais intuitivo com a função plot():


plot(m)

Para finalizar, fazemos algumas adições ao modelo para mostrar outros pontos importantes. Abaixo, trabalhamos com 3 classes, e, para garantir a convergência da estimação (algo que nem sempre ocorre com a função), aumentamos o número de iterações de 1000 para 2500, e rodamos ele 5 vezes. Ademais, mudamos a fórmula para incluir a variável assistência ao pagamento (PAYASST), de modo a identificar como as classes que encontramos se relacionam com ela.


tratamento$PAYASST <- data$PAYASST
tratamento$PAYASST[tratamento$PAYASST < 0] <- NA

m <- poLCA(cbind(TREATPSYCHOTHRPY, TREATFAMTHRPY,
TREATGRPTHRPY, TREATCOGTHRPY,
TREATPSYCHOMED) ~ PAYASST,
data = tratamento, nclass = 3,
maxiter = 2500, nrep = 5)

Como vemos no resultado, temos 3 classes com características distintas: a classe 1 (cerca de 12% da população) tem diversos tratamentos, exceto terapia familiar; a 2 e a 3 (79 e 9% da população, respectivamente), incluem todos os tratamentos, exceto pelo fato de que a 2 tem probabilidade muito menor de incluir medicação. Ademais, podemos verificar a relação que cada classe tem com a assistência ao pagamento: em comparação com a classe 1, clínicas da classe 2 tendem a oferecer menos assistência, enquanto clínicas da classe 3 tendem a oferecer mais.

________________________
(*) Para entender mais sobre análises estatísticas, confira nosso Curso de Estatística usando R e Python.

Compartilhe esse artigo

Facebook
Twitter
LinkedIn
WhatsApp
Telegram
Email
Print

Comente o que achou desse artigo

Outros artigos relacionados

Análise de impacto fiscal sobre o dolár com Python

Usamos uma cesta de 12 moedas para construir um cenário contrafactual da taxa de câmbio após o último anúncio de pacote fiscal, com base em modelagem Bayesiana. No período, o dolár depreciou quase 5% e passou os R$ 6,15, enquanto que na ausência da intervenção a moeda deveria estar cotada em R$ 5,78.

Resultado IBC-br - Outubro/2024

A Análise Macro apresenta os resultados da IBC-br de Outubro de 2024, com gráficos elaborados em Python para coleta, tratamento e visualização de dados. Todo o conteúdo, disponível exclusivamente no Clube AM, foi desenvolvido com base nos métodos ensinados nos cursos da Análise Macro, permitindo aos assinantes acesso aos códigos e replicação das análises.

Resultado PMC - Outubro/2024

A Análise Macro apresenta os resultados da PMC de Outubro de 2024, com gráficos elaborados em Python para coleta, tratamento e visualização de dados. Todo o conteúdo, disponível exclusivamente no Clube AM, foi desenvolvido com base nos métodos ensinados nos cursos da Análise Macro, permitindo aos assinantes acesso aos códigos e replicação das análises.

Boletim AM

Receba diretamente em seu e-mail gratuitamente nossas promoções especiais e conteúdos exclusivos sobre Análise de Dados!

Boletim AM

Receba diretamente em seu e-mail gratuitamente nossas promoções especiais e conteúdos exclusivos sobre Análise de Dados!

como podemos ajudar?

Preencha os seus dados abaixo e fale conosco no WhatsApp

Boletim AM

Preencha o formulário abaixo para receber nossos boletins semanais diretamente em seu e-mail.