| Campo DC | Valor | Idioma |
| dc.contributor.advisor | Garcia, Luís Paulo Faina | pt_BR |
| dc.contributor.author | Neto, Fernando Hurias Lopes | pt_BR |
| dc.date.accessioned | 2026-08-21T21:45:37Z | - |
| dc.date.available | 2026-08-21T21:45:37Z | - |
| dc.date.issued | 2026-08-21 | - |
| dc.date.submitted | 2026-05-20 | - |
| dc.identifier.citation | NETO, Fernando Hurias Lopes. Reconhecimento de entidades nomeadas em documentos legais. 2026. 80 f., il. Dissertação (Mestrado em Informática) — Universidade de Brasília, Brasília, 2026. | pt_BR |
| dc.identifier.uri | http://repositorio.unb.br/handle/10482/55730 | - |
| dc.description | Dissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Informática, 2026. | pt_BR |
| dc.description.abstract | O sistema judiciário brasileiro é caracterizado por um extenso volume de documentos e linguagem altamente técnica, o que demanda métodos eficientes para automatizar a análise de textos jurídicos. O Reconhecimento de Entidades Nomeadas (NER), que identifica elementos como leis, tribunais e atores jurídicos, representa um desafio significativo nesse contexto. Embora o NER em português ainda seja pouco explorado, diversas abordagens, incluindo modelos estatísticos, redes neurais e transformers, têm sido investigadas. No entanto, esses estudos frequentemente carecem de comparações abrangentes entre diferentes modelos e conjuntos de dados. Este estudo aborda essa lacuna apresentando uma avaliação comparativa abrangente de modelos NER no domínio jurídico brasileiro, analisando os conjuntos de dados públicos disponíveis: LeNER-BR (acórdãos), CDJUR-BR (sentenças criminais) e UlyssesNER-BR (textos legislativos). Foram avaliados 23 modelos no total, considerando suas versões puras e variações combinadas com camadas BiLSTM, CRF, CNN e IDCNN. O conjunto abrange abordagens clássicas (CRF, BiLSTM), baseados em transformers (BERT, XLNet, ELECTRA) e híbridas. O estudo avaliou o desempenho usando métricas de Precision, Recall e F1-Score, combinadas com testes estatísticos de Friedman e Nemenyi para identificar diferenças significativas. Os resultados indicam que abordagens híbridas superam consistentemente os modelos isolados, com destaques específicos por conjunto: BERT-BiLSTM-CRF alcançou o F1-Score de 0,9440 no LeNER-BR, BERT-CRF atingiu 0,8020 no UlyssesNER-BR e BERT-BiLSTM obteve 0,8800 no CDJUR-BR. Testes estatísticos confirmaram diferenças significativas (p < 0,05) entre os modelos híbridos e suas contrapartes clássicas. A análise por entidade revelou que transformers puros se destacam em entidades semanticamente ricas, enquanto as abordagens híbridas são superiores para categorias com dependências sequenciais, demonstrando que a escolha da arquitetura deve considerar a natureza específica de cada corpus jurídico. | pt_BR |
| dc.description.sponsorship | Coordenação de Aperfeiçoamento de Pessoal de Nível Superior (CAPES) | - |
| dc.language.iso | por | pt_BR |
| dc.rights | Acesso Aberto | pt_BR |
| dc.title | Reconhecimento de entidades nomeadas em documentos legais | pt_BR |
| dc.type | Dissertação | pt_BR |
| dc.subject.keyword | Documentos | pt_BR |
| dc.subject.keyword | Brasil | pt_BR |
| dc.subject.keyword | Modelos de linguagem | pt_BR |
| dc.rights.license | A concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data. | pt_BR |
| dc.description.abstract1 | The Brazilian judicial system is characterized by a vast volume of documents and highly
technical language, demanding efficient methods to automate the analysis of legal texts.
Named Entity Recognition (NER), which identifies elements such as laws, courts, and le gal actors, represents a significant challenge in this context. Although NER in Portuguese
is still relatively unexplored, several approaches, including statistical models, neural net works, and transformers, have been investigated. However, these studies often lack com prehensive comparisons between different models and datasets. This study addresses this
gap by presenting a comprehensive comparative evaluation of NER models in the Brazil ian legal domain, analyzing the publicly available datasets: LeNER-BR (court decisions),
CDJUR-BR (criminal sentences), and UlyssesNER-BR (legislative texts). A total of 23
models were evaluated, considering their pure versions and variations combined with BiL STM, CRF, CNN, and IDCNN layers. The set encompasses classical (CRF, BiLSTM),
transformer-based (BERT, XLNet, ELECTRA), and hybrid approaches. The study evalu ated performance using Precision, Recall, and F1-Score metrics, combined with Friedman
and Nemenyi statistical tests to identify significant differences. The results indicate that
hybrid approaches consistently outperform stand-alone models, with specific highlights
per set: BERT-BiLSTM-CRF achieved an F1-Score of 0.9440 on LeNER-BR, BERT-CRF
reached 0.8020 on UlyssesNER-BR, and BERT-BiLSTM obtained 0.8800 on CDJUR-BR.
Statistical tests confirmed significant differences (p < 0.05) between the hybrid models
and their classical counterparts. Entity analysis revealed that pure transformers excel
in semantically rich entities, while hybrid approaches are superior for categories with se quential dependencies, demonstrating that the choice of architecture should consider the
specific nature of each legal corpus. | pt_BR |
| dc.description.unidade | Instituto de Ciências Exatas (IE) | pt_BR |
| dc.description.unidade | Departamento de Ciência da Computação (IE CIC) | pt_BR |
| dc.description.ppg | Programa de Pós-Graduação em Informática | pt_BR |
| Aparece nas coleções: | Teses, dissertações e produtos pós-doutorado
|