Skip navigation
Veuillez utiliser cette adresse pour citer ce document : http://repositorio.unb.br/handle/10482/55730
Fichier(s) constituant ce document :
Fichier TailleFormat 
FernandoHuriasLopesNeto_DISSERT.pdf2,23 MBAdobe PDFVoir/Ouvrir
Titre: Reconhecimento de entidades nomeadas em documentos legais
Auteur(s): Neto, Fernando Hurias Lopes
Orientador(es):: Garcia, Luís Paulo Faina
Assunto:: Documentos
Brasil
Modelos de linguagem
Date de publication: 21-aoû-2026
Référence bibliographique: NETO, Fernando Hurias Lopes. Reconhecimento de entidades nomeadas em documentos legais. 2026. 80 f., il. Dissertação (Mestrado em Informática) — Universidade de Brasília, Brasília, 2026.
Résumé: O sistema judiciário brasileiro é caracterizado por um extenso volume de documentos e linguagem altamente técnica, o que demanda métodos eficientes para automatizar a análise de textos jurídicos. O Reconhecimento de Entidades Nomeadas (NER), que identifica elementos como leis, tribunais e atores jurídicos, representa um desafio significativo nesse contexto. Embora o NER em português ainda seja pouco explorado, diversas abordagens, incluindo modelos estatísticos, redes neurais e transformers, têm sido investigadas. No entanto, esses estudos frequentemente carecem de comparações abrangentes entre diferentes modelos e conjuntos de dados. Este estudo aborda essa lacuna apresentando uma avaliação comparativa abrangente de modelos NER no domínio jurídico brasileiro, analisando os conjuntos de dados públicos disponíveis: LeNER-BR (acórdãos), CDJUR-BR (sentenças criminais) e UlyssesNER-BR (textos legislativos). Foram avaliados 23 modelos no total, considerando suas versões puras e variações combinadas com camadas BiLSTM, CRF, CNN e IDCNN. O conjunto abrange abordagens clássicas (CRF, BiLSTM), baseados em transformers (BERT, XLNet, ELECTRA) e híbridas. O estudo avaliou o desempenho usando métricas de Precision, Recall e F1-Score, combinadas com testes estatísticos de Friedman e Nemenyi para identificar diferenças significativas. Os resultados indicam que abordagens híbridas superam consistentemente os modelos isolados, com destaques específicos por conjunto: BERT-BiLSTM-CRF alcançou o F1-Score de 0,9440 no LeNER-BR, BERT-CRF atingiu 0,8020 no UlyssesNER-BR e BERT-BiLSTM obteve 0,8800 no CDJUR-BR. Testes estatísticos confirmaram diferenças significativas (p < 0,05) entre os modelos híbridos e suas contrapartes clássicas. A análise por entidade revelou que transformers puros se destacam em entidades semanticamente ricas, enquanto as abordagens híbridas são superiores para categorias com dependências sequenciais, demonstrando que a escolha da arquitetura deve considerar a natureza específica de cada corpus jurídico.
Abstract: The Brazilian judicial system is characterized by a vast volume of documents and highly technical language, demanding efficient methods to automate the analysis of legal texts. Named Entity Recognition (NER), which identifies elements such as laws, courts, and le gal actors, represents a significant challenge in this context. Although NER in Portuguese is still relatively unexplored, several approaches, including statistical models, neural net works, and transformers, have been investigated. However, these studies often lack com prehensive comparisons between different models and datasets. This study addresses this gap by presenting a comprehensive comparative evaluation of NER models in the Brazil ian legal domain, analyzing the publicly available datasets: LeNER-BR (court decisions), CDJUR-BR (criminal sentences), and UlyssesNER-BR (legislative texts). A total of 23 models were evaluated, considering their pure versions and variations combined with BiL STM, CRF, CNN, and IDCNN layers. The set encompasses classical (CRF, BiLSTM), transformer-based (BERT, XLNet, ELECTRA), and hybrid approaches. The study evalu ated performance using Precision, Recall, and F1-Score metrics, combined with Friedman and Nemenyi statistical tests to identify significant differences. The results indicate that hybrid approaches consistently outperform stand-alone models, with specific highlights per set: BERT-BiLSTM-CRF achieved an F1-Score of 0.9440 on LeNER-BR, BERT-CRF reached 0.8020 on UlyssesNER-BR, and BERT-BiLSTM obtained 0.8800 on CDJUR-BR. Statistical tests confirmed significant differences (p < 0.05) between the hybrid models and their classical counterparts. Entity analysis revealed that pure transformers excel in semantically rich entities, while hybrid approaches are superior for categories with se quential dependencies, demonstrating that the choice of architecture should consider the specific nature of each legal corpus.
metadata.dc.description.unidade: Instituto de Ciências Exatas (IE)
Departamento de Ciência da Computação (IE CIC)
Description: Dissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Informática, 2026.
metadata.dc.description.ppg: Programa de Pós-Graduação em Informática
Licença:: A concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data.
Agência financiadora: Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)
Collection(s) :Teses, dissertações e produtos pós-doutorado

Affichage détaillé " class="statisticsLink btn btn-primary" href="/handle/10482/55730/statistics">



Tous les documents dans DSpace sont protégés par copyright, avec tous droits réservés.