Neste artigo apresentamos o modelo Naive Bayes para problemas de classificação binária de textos. Mostramos a intuição do modelo e sua formulação matemática, além de pontuar as principais aplicações e casos de uso. Ao final, demonstramos um exemplo aplicado à classificação de spam em comentários do YouTube, usando a linguagem de programação Python.
Como quantificar sobre o que se trata um texto? Que tipo de informação podemos obter a partir destes dados? Como identificar a relevância das palavras? Neste artigo exploramos técnicas estatísticas de frequência de tokens para extrair informação de dados textuais.
Antes de qualquer análise, o texto precisa virar dado. Este artigo apresenta as etapas que fazem essa transformação — tokenização, remoção de stop words, stemming e lemmatizing —, explica o que cada uma resolve e em que ordem se encadeiam. No exercício aplicado a uma ata do COPOM, 42% das palavras são descartadas antes que a análise comece.
Manejar dados textuais é diferente de manejar uma tabela com números. Este artigo apresenta as ferramentas do Python que resolvem essa etapa: as operações básicas sobre strings — contar, combinar, recortar e padronizar — e as expressões regulares, que descrevem padrões sem depender da posição exata da informação no documento.
O primeiro passo de todo projeto de mineração de textos é identificar, coletar e preparar os dados brutos. Este artigo apresenta as bases públicas de Economia e Finanças que podem ser exploradas — atas do COPOM, discursos de banqueiros centrais do BIS e cartas de gestores — e as bibliotecas de Python que fazem a coleta de cada formato.