Skip navigation
Use este identificador para citar ou linkar para este item: http://repositorio.unb.br/handle/10482/55730
Arquivos associados a este item:
Arquivo TamanhoFormato 
FernandoHuriasLopesNeto_DISSERT.pdf2,23 MBAdobe PDFVisualizar/Abrir
Registro completo de metadados
Campo DCValorIdioma
dc.contributor.advisorGarcia, Luís Paulo Fainapt_BR
dc.contributor.authorNeto, Fernando Hurias Lopespt_BR
dc.date.accessioned2026-08-21T21:45:37Z-
dc.date.available2026-08-21T21:45:37Z-
dc.date.issued2026-08-21-
dc.date.submitted2026-05-20-
dc.identifier.citationNETO, Fernando Hurias Lopes. Reconhecimento de entidades nomeadas em documentos legais. 2026. 80 f., il. Dissertação (Mestrado em Informática) — Universidade de Brasília, Brasília, 2026.pt_BR
dc.identifier.urihttp://repositorio.unb.br/handle/10482/55730-
dc.descriptionDissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Informática, 2026.pt_BR
dc.description.abstractO sistema judiciário brasileiro é caracterizado por um extenso volume de documentos e linguagem altamente técnica, o que demanda métodos eficientes para automatizar a análise de textos jurídicos. O Reconhecimento de Entidades Nomeadas (NER), que identifica elementos como leis, tribunais e atores jurídicos, representa um desafio significativo nesse contexto. Embora o NER em português ainda seja pouco explorado, diversas abordagens, incluindo modelos estatísticos, redes neurais e transformers, têm sido investigadas. No entanto, esses estudos frequentemente carecem de comparações abrangentes entre diferentes modelos e conjuntos de dados. Este estudo aborda essa lacuna apresentando uma avaliação comparativa abrangente de modelos NER no domínio jurídico brasileiro, analisando os conjuntos de dados públicos disponíveis: LeNER-BR (acórdãos), CDJUR-BR (sentenças criminais) e UlyssesNER-BR (textos legislativos). Foram avaliados 23 modelos no total, considerando suas versões puras e variações combinadas com camadas BiLSTM, CRF, CNN e IDCNN. O conjunto abrange abordagens clássicas (CRF, BiLSTM), baseados em transformers (BERT, XLNet, ELECTRA) e híbridas. O estudo avaliou o desempenho usando métricas de Precision, Recall e F1-Score, combinadas com testes estatísticos de Friedman e Nemenyi para identificar diferenças significativas. Os resultados indicam que abordagens híbridas superam consistentemente os modelos isolados, com destaques específicos por conjunto: BERT-BiLSTM-CRF alcançou o F1-Score de 0,9440 no LeNER-BR, BERT-CRF atingiu 0,8020 no UlyssesNER-BR e BERT-BiLSTM obteve 0,8800 no CDJUR-BR. Testes estatísticos confirmaram diferenças significativas (p < 0,05) entre os modelos híbridos e suas contrapartes clássicas. A análise por entidade revelou que transformers puros se destacam em entidades semanticamente ricas, enquanto as abordagens híbridas são superiores para categorias com dependências sequenciais, demonstrando que a escolha da arquitetura deve considerar a natureza específica de cada corpus jurídico.pt_BR
dc.description.sponsorshipCoordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES)-
dc.language.isoporpt_BR
dc.rightsAcesso Abertopt_BR
dc.titleReconhecimento de entidades nomeadas em documentos legaispt_BR
dc.typeDissertaçãopt_BR
dc.subject.keywordDocumentospt_BR
dc.subject.keywordBrasilpt_BR
dc.subject.keywordModelos de linguagempt_BR
dc.rights.licenseA concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data.pt_BR
dc.description.abstract1The Brazilian judicial system is characterized by a vast volume of documents and highly technical language, demanding efficient methods to automate the analysis of legal texts. Named Entity Recognition (NER), which identifies elements such as laws, courts, and le gal actors, represents a significant challenge in this context. Although NER in Portuguese is still relatively unexplored, several approaches, including statistical models, neural net works, and transformers, have been investigated. However, these studies often lack com prehensive comparisons between different models and datasets. This study addresses this gap by presenting a comprehensive comparative evaluation of NER models in the Brazil ian legal domain, analyzing the publicly available datasets: LeNER-BR (court decisions), CDJUR-BR (criminal sentences), and UlyssesNER-BR (legislative texts). A total of 23 models were evaluated, considering their pure versions and variations combined with BiL STM, CRF, CNN, and IDCNN layers. The set encompasses classical (CRF, BiLSTM), transformer-based (BERT, XLNet, ELECTRA), and hybrid approaches. The study evalu ated performance using Precision, Recall, and F1-Score metrics, combined with Friedman and Nemenyi statistical tests to identify significant differences. The results indicate that hybrid approaches consistently outperform stand-alone models, with specific highlights per set: BERT-BiLSTM-CRF achieved an F1-Score of 0.9440 on LeNER-BR, BERT-CRF reached 0.8020 on UlyssesNER-BR, and BERT-BiLSTM obtained 0.8800 on CDJUR-BR. Statistical tests confirmed significant differences (p < 0.05) between the hybrid models and their classical counterparts. Entity analysis revealed that pure transformers excel in semantically rich entities, while hybrid approaches are superior for categories with se quential dependencies, demonstrating that the choice of architecture should consider the specific nature of each legal corpus.pt_BR
dc.description.unidadeInstituto de Ciências Exatas (IE)pt_BR
dc.description.unidadeDepartamento de Ciência da Computação (IE CIC)pt_BR
dc.description.ppgPrograma de Pós-Graduação em Informáticapt_BR
Aparece nas coleções:Teses, dissertações e produtos pós-doutorado

Mostrar registro simples do item Visualizar estatísticas



Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.