Introdução a pré-processamento de dados textuais para mineração de textos

Antes de qualquer análise, o texto precisa virar dado. Este artigo apresenta as etapas que fazem essa transformação — tokenização, remoção de stop words, stemming e lemmatizing —, explica o que cada uma resolve e em que ordem se encadeiam. No exercício aplicado a uma ata do COPOM, 42% das palavras são descartadas antes que a análise comece.


Já exploramos as capacidades da mineração de textos e vimos que existem muitos dados para serem analisados por aí. Agora surge a pergunta seguinte: como começar? De tokens até stop words, passando por procedimentos de stemming e lemmatizing, neste artigo introduzimos as principais técnicas de preparação de dados textuais para a análise.

Como na maioria das aplicações de ciência de dados, o caminho entre o problema e a solução não costuma ser direto, rápido ou fácil. Na mineração de textos não é diferente: precisamos tornar os nossos dados "analisáveis", e isso nos leva aos procedimentos de pré-processamento, que são vários.

Ilustração de tokenização no pré-processamento de dados textuais: cada palavra da frase destacada em uma cor diferente
A tokenização separa o texto em unidades analisáveis: cada cor é um token.

No exercício que acompanha este artigo, aplicamos todas essas etapas ao texto de uma ata do COPOM. O documento começa com 2.756 palavras e termina com 1.607 depois da limpeza, ou seja, 42% do texto é descartado antes que a análise comece.

📬 Estatística, econometria e IA aplicada. Todo dia, no seu e-mail.

O Boletim AM traz modelos estatísticos, econometria e LLMs aplicados a Economia, Finanças e análise de dados, com exemplos em R e Python. Todo domingo, às 20h, uma leitura mais longa que reúne as fontes da semana.

Quero receber o Boletim AM →

O que é pré-processamento de dados textuais?

O pré-processamento de dados na mineração de textos são rotinas de tratamento cujo objetivo é transformar os dados brutos, sejam textos ou arquivos, em uma representação analítica, ou seja, em um formato vetorial ou tabular.

A razão é que nenhum método estatístico opera sobre um parágrafo. Contar, comparar ou classificar exige que o texto esteja quebrado em unidades comparáveis entre si, e é esse o trabalho das etapas a seguir.

Esses pré-processamentos costumam envolver a tokenização do texto, a remoção de stop words, de números e de pontuações, além da stemização e da lematização. Todos são feitos via linguagem de programação, o que possibilita a automatização e a escalabilidade do processo.

O que é tokenização?

"Tokenizar" significa separar um texto de modo a obter unidades para análise posterior, ou seja, os tokens. Um token geralmente é uma palavra, mas pode ser um conjunto de palavras, uma sentença ou um parágrafo.

Esse processo facilita a análise dos dados quando o objetivo é contar, filtrar, categorizar ou agrupar os tokens. É a primeira etapa porque todas as demais operam sobre a lista resultante, e não mais sobre o texto corrido.

O que são stop words?

As chamadas stop words são palavras consideradas irrelevantes para a análise dos dados textuais, por não carregarem emoção nem valor semântico, ou por não alterarem o sentido do texto ao serem removidas.

Ilustração de stop words no pré-processamento de dados textuais: artigos, preposições e conjunções destacados em azul na frase
As stop words destacadas em azul: artigos, preposições e conjunções que aparecem em qualquer texto.

Geralmente são definidas em uma lista de stop words as classes de palavras auxiliares: conjunções, preposições, pronomes, artigos e advérbios. Outros caracteres também costumam ser removidos, como números, pontuações e caracteres especiais.

A remoção descarta uma parcela grande do documento, e é isso que se espera. Na ata do COPOM usada como exemplo, 42% dos tokens saem nessa etapa, justamente por serem as palavras que aparecem em qualquer texto e não distinguem uma ata de outra.

O que é stemming?

Stemming, ou normalização morfológica, é o processo de eliminar variações morfológicas de uma palavra, visando reduzi-la ao seu radical. Assim, eliminam-se os prefixos e sufixos, além de outras variações que podem estar presentes, como de gênero, número e grau.

Ilustração de stemming no pré-processamento de dados textuais: o radical de cada palavra destacado em azul
O stemming reduz cada palavra ao seu radical, destacado em azul.

O problema que ele resolve é a contagem dividida. Sem essa etapa, "analisamos", "analisaram" e "análise" entram como três termos distintos em qualquer medida de frequência, ainda que tratem do mesmo conceito.

O que é lemmatizing?

Lemmatizing é o processo de transformar um token no lema correspondente da palavra, ou seja, na forma em que as variações dessa palavra são escritas no dicionário. O resultado do procedimento é um token que existe na gramática.

Ilustração de lemmatizing no pré-processamento de dados textuais: o lema de cada token destacado em azul
O lemmatizing devolve o lema de cada token, a forma que consta no dicionário.

Stemming ou lemmatizing?

Os dois resolvem o mesmo problema por caminhos diferentes, e a escolha depende do que será feito com o resultado.

Critério Stemming Lemmatizing
Como funciona Corta prefixos e sufixos por regras fixas Consulta a gramática e o vocabulário da língua
Resultado Um radical, que pode não existir no dicionário Uma palavra real da língua
Exemplo "econômica" vira "econôm" "econômica" vira "econômico"
Velocidade Rápido, não carrega modelo Mais lento, exige um modelo de língua
Quando usar Agrupar variações para contagem Quando o resultado será lido ou interpretado

O stemming é mais agressivo e mais rápido, o que serve quando o objetivo é apenas agrupar variações para uma contagem de frequência. O lemmatizing preserva palavras legíveis, o que importa quando o resultado será lido por uma pessoa ou usado em uma análise de significado.

A ordem das etapas

As etapas se encadeiam, e cada uma trabalha sobre o resultado da anterior.

🧹

1. Limpar
Remover marcação, números e pontuação, e padronizar a caixa das letras.

✂️

2. Tokenizar
Separar o texto corrido em palavras, que passam a ser as unidades de análise.

🚫

3. Filtrar
Descartar as stop words, que não distinguem um documento de outro.

🌱

4. Normalizar
Reduzir as variações de cada palavra a uma forma única, por stemming ou lemmatizing.

A limpeza vem primeiro porque a pontuação atrapalha a separação em palavras. A filtragem vem depois da tokenização porque as stop words são comparadas token a token contra uma lista. E a normalização vem por último porque opera sobre menos palavras, já sem as que seriam descartadas de qualquer forma.

As ferramentas vêm prontas. As bibliotecas de processamento de linguagem natural do Python trazem as listas de stop words por idioma e os algoritmos de radicalização, inclusive um desenvolvido especificamente para o português. Para o lemmatizing, é preciso carregar um modelo da língua, que traz o vocabulário e as regras gramaticais.

Considerações finais

De tokens até stop words, passando por procedimentos de stemming e lemmatizing, entre outros, neste artigo introduzimos as principais técnicas e conceitos de mineração de textos, preparando os dados para a análise.

Cada escolha dessas altera o que a análise vai encontrar. Uma lista de stop words que inclua "não" apaga as negações do documento, e um stemming agressivo demais junta palavras de sentidos distintos sob o mesmo radical. O texto tratado é que vai alimentar as técnicas de extração de informação e, adiante, a análise de sentimentos.

O percurso muda pouco de uma área para outra, e o que varia é a aplicação:

  • Economista: prepara atas e comunicados para medir a frequência de termos e comparar documentos ao longo do tempo.
  • Analista de investimentos: trata cartas de gestores e relatórios antes de extrair os temas recorrentes de cada período.
  • Cientista de dados: monta a etapa de limpeza que antecede qualquer modelo de classificação ou agrupamento de textos.
  • Pesquisador: normaliza acervos grandes para que variações de grafia não fragmentem a contagem de um mesmo conceito.

Aprender a linguagem é o que abre a porta para todas essas frentes.

Linguagem Econômica: mineração de textos de Bancos Centrais

Os dez capítulos do livro digital percorrem o caminho completo: dos primeiros tratamentos de texto ao indicador de sentimentos do COPOM e à classificação do tom da política monetária com IA generativa. Exercícios aplicados, em Python.

Livro digital Linguagem Econômica: mineração de textos de Bancos Centrais, da Análise Macro
Acessar o livro digital →

Leia também:

Compartilhe esse artigo

Facebook
Twitter
LinkedIn
WhatsApp
Telegram
Email
Print
Análise Macro © 2011 / 2026

comercial@analisemacro.com.br – Rua Visconde de Pirajá, 414, Sala 718
Ipanema, Rio de Janeiro – RJ – CEP: 22410-002

como podemos ajudar?

Preencha os seus dados abaixo e fale conosco no WhatsApp