http://repositorio.unb.br/handle/10482/57026| Fichero | Descripción | Tamaño | Formato | |
|---|---|---|---|---|
| MayraDeMoraesCampos_DISSERT.pdf | 31,69 MB | Adobe PDF | Visualizar/Abrir |
| Título : | Classificação de textos de bases desbalanceadas aplicada às solicitações cidadãs |
| Autor : | Campos, Mayra de Moraes |
| Orientador(es):: | Marotta, Marcelo Antonio |
| Assunto:: | Classificação de texto Serviço Público Automatização |
| Fecha de publicación : | 29-sep-2026 |
| Data de defesa:: | 27-abr-2026 |
| Citación : | CAMPOS, Mayra de Moraes. Classificação de textos de bases desbalanceadas aplicada às solicitações cidadãs. 2026. 82 f., il. Dissertação (Mestrado profissional em Computação Aplicada) — Universidade de Brasília, Brasília, 2026. |
| Resumen : | Este estudo de caso investigou alternativas para automatizar a classificação binária de textos com classes desbalanceadas no contexto do Participa DF, uma plataforma de par ticipação social do GDF. Esse canal digital tem como objetivo ampliar a participação cidadã na gestão pública do Distrito Federal por meio de manifestações textuais. Esses textos são enviados pelos cidadãos ao Participa DF e categorizados manualmente pelos usuários entre dois sistemas: o e-SIC DF e o Ouv-DF. Diversas técnicas de PLN foram aplicadas, como redução de dimensionalidade por PCA, métodos de redimensionamento (como o NM), além de múltiplos algoritmos de AM, tais como BERTimbau, LR, SVM e LGBM. A avaliação priorizou a capacidade de identificar a classe minoritária e-SIC DF, cuja classificação correta é especialmente difícil. O desbalanceamento normalmente compromete a eficácia de modelos tradicionais de AM. Entre os métodos analisados, destaca-se o EFC, originalmente desenvolvido para detecção de anomalias em redes e explorado neste trabalho pela primeira vez em tarefas de classificação textual. Esse al goritmo utiliza estatísticas inversas para treinar modelos. Os resultados mostram que o EFC, quando treinado exclusivamente com exemplos da classe e-SIC DF e submetido a um nível reduzido de pré-processamento, atinge alto Recall (94%), demonstrando forte capacidade de reconhecer a classe minoritária. Entretanto, apresentou elevada taxa de FDR, o que implicaria aumento significativo do retrabalho por parte dos servidores re sponsáveis pelo tratamento das manifestações e pela reclassificação. Em comparação com o EFC, modelos clássicos e modelos baseados em transformers apresentaram desempenho mais equilibrado entre Recall, F1-Score, AUC-ROC e Acurácia. Conclui-se que, apesar de o EFC ser promissor para cenários de detecção de anomalias em conjuntos de dados textuais desbalanceados, ele gera muitos falsos positivos. Para implantação no ambiente de produção da plataforma Participa DF, o modelo treinado com o algoritmo SVM, com redução de dimensionalidade via PCA e uso de textos sintéticos, mostrou-se a alternativa tecnicamente mais viável. |
| Abstract: | This case study investigated alternatives for automating the binary classification of texts with imbalanced classes in the context of Participa DF, a social participation platform of the GDF. This digital channel aims to enhance citizen participation in the public adminis tration of the Federal District through textual submissions. These texts are submitted by citizens to Participa DF and manually categorized by users into two systems: e-SIC DF and Ouv-DF. Several NLP techniques were applied, including dimensionality reduction via PCA, resampling methods (such as NM), as well as multiple ML algorithms, including BERTimbau, LR, SVM, and LGBM. The evaluation prioritized the ability to identify the minority class, e-SIC DF, whose correct classification is particularly challenging. Class imbalance typically compromises the e!ectiveness of traditional ML models. Among the methods analyzed, the EFC algorithm stands out. Originally developed for anomaly detection in networks, it is explored in this work for the first time in textual classifica tion tasks. This algorithm employs inverse statistics to train models. The results show that EFC, when trained exclusively on examples from the e-SIC DF class and subjected to a reduced level of preprocessing, achieves high Recall (94%), demonstrating a strong ability to recognize the minority class. However, it also exhibited a high FDR, which would imply a significant increase in rework for public servants responsible for handling and reclassifying the submissions. In comparison with EFC, classical models and trans former -based models exhibited a more balanced performance across Recall, F1-Score, AUC-ROC, and Accuracy. It is concluded that, although EFC is promising for anomaly detection scenarios in imbalanced textual datasets, it generates a large number of false positives. For deployment in the production environment of the Participa DF platform, the model trained using the SVM algorithm, combined with dimensionality reduction via PCA and the use of synthetic texts, proved to be the most technically viable alternative. |
| metadata.dc.description.unidade: | Instituto de Ciências Exatas (IE) Departamento de Ciência da Computação (IE CIC) |
| Descripción : | Dissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Computação Aplicada, 2026. |
| metadata.dc.description.ppg: | Programa de Pós-Graduação em Computação Aplicada, Mestrado Profissional |
| Licença:: | A concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data. |
| Agência financiadora: | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) |
| Aparece en las colecciones: | Teses, dissertações e produtos pós-doutorado |
Los ítems de DSpace están protegidos por copyright, con todos los derechos reservados, a menos que se indique lo contrario.