Skip navigation
Use este identificador para citar ou linkar para este item: http://repositorio.unb.br/handle/10482/57031
Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
GustavoVieiraRochaRabelo_DISSERT.pdf30,64 MBAdobe PDFVisualizar/Abrir
Registro completo de metadados
Campo DCValorIdioma
dc.contributor.advisorVidal, Flávio de Barros-
dc.contributor.authorRabelo, Gustavo Vieira Rocha-
dc.date.accessioned2026-09-29T17:55:17Z-
dc.date.available2026-09-29T17:55:17Z-
dc.date.issued2026-09-29-
dc.date.submitted2026-08-11-
dc.identifier.citationRABELO, Gustavo Vieira Rocha. Detecção de áudios sintéticos com análise de robustez a ruído utilizando espectrogramas Mel e redes neurais convolucionais. 2026. 130 f., il. Dissertação (Mestrado em Informática) — Universidade de Brasília, Brasília, 2026.pt_BR
dc.identifier.urihttp://repositorio.unb.br/handle/10482/57031-
dc.descriptionDissertação (mestrado) — Universidade de Brasília, Instituto de Ciências Exatas, Departamento de Ciência da Computação, Programa de Pós-Graduação em Informática, 2026.pt_BR
dc.description.abstractOs rápidos avanços em modelos de síntese de fala baseados em redes neuraistêm introduzido desafios para a identificação de áudios sintéticos geradospor essas tecnologias. Entre as ferramentas utilizadas nesse contexto estáo vocoder (do inglês voice encoder), um modelo capaz de analisar esintetizar sinais de voz. Ele permite não apenas a compactação e amodificação do áudio, mas também a geração de fala artificial, incluindo arecriação do timbre e das características específicas de uma voz humana.Este trabalho implementa uma abordagem para detectar o uso de vocodersneurais por meio da análise de imagens de espectrogramas Mel, utilizandoredes neurais convolucionais (CNNs) para identificar característicasdistintivas presentes em áudios gerados por vocoders. Começando com umavisão geral abrangente dos vocoders, seu desenvolvimento histórico e astecnologias que impulsionaram os avanços dos vocoders neurais, destacamos atransição das técnicas tradicionais de processamento de sinal para asíntese impulsionada por aprendizado profundo. Nossa abordagem envolvetestar várias arquiteturas de CNNs e estressá-las sob diferentes condiçõesde ruído para avaliar a robustez e a eficácia de cada modelo na distinçãoentre imagens de espectrogramas de áudios sintéticos e reais. Os resultadosdemonstram que esse método baseado em imagens é eficaz para a detecção devocoders, embora testes adicionais sejam necessários para melhorar odesempenho em diversos ambientes de áudio e tipos de vocoders.pt_BR
dc.language.isoporpt_BR
dc.rightsAcesso Abertopt_BR
dc.titleDetecção de áudios sintéticos com análise de robustez a ruído utilizando espectrogramas Mel e redes neurais convolucionaispt_BR
dc.typeDissertaçãopt_BR
dc.subject.keywordEspectrograma Melpt_BR
dc.subject.keywordForensept_BR
dc.subject.keywordRedes neuraispt_BR
dc.subject.keywordDetecção de áudio sintéticopt_BR
dc.rights.licenseA concessão da licença deste item refere-se ao termo de autorização impresso assinado pelo autor com as seguintes condições: Na qualidade de titular dos direitos de autor da publicação, autorizo a Universidade de Brasília e o IBICT a disponibilizar por meio dos sites www.unb.br, www.ibict.br, www.ndltd.org sem ressarcimento dos direitos autorais, de acordo com a Lei nº 9610/98, o texto integral da obra supracitada, conforme permissões assinaladas, para fins de leitura, impressão e/ou download, a título de divulgação da produção científica brasileira, a partir desta data.pt_BR
dc.description.abstract1Recent advances in neural network–based speech synthesis have created significant chal lenges for the identification of synthetic audio generated by these technologies. Among the tools used in this context is the vocoder (a term derived from the contraction of voice encoder), a model capable of analyzing and synthesizing speech signals. It enables not only the compression and modification of audio but also the generation of artificial speech, including the recreation of a human voice’s timbre and specific characteristics. This work implements an approach to detect neural vocoders through the analysis of Mel spectrogram images, using convolutional neural networks (CNNs) to identify distinctive features present in audio generated by vocoders. Starting with a comprehensive overview of vocoders, their historical development, and the technologies that have driven the ad vances in neural vocoders, we highlight the transition from traditional signal processing techniques to deep learning–driven synthesis. Our approach involves testing multiple CNN architectures and subjecting them to different noise conditions to assess each model’s ro bustness and effectiveness in distinguishing between spectrogram images of synthetic and real audio. The results demonstrate that this image-based method is effective for vocoder detection, although further testing is required to improve performance across diverse audio environments and vocoder types.pt_BR
dc.description.unidadeInstituto de Ciências Exatas (IE)pt_BR
dc.description.unidadeDepartamento de Ciência da Computação (IE CIC)pt_BR
dc.description.ppgPrograma de Pós-Graduação em Informáticapt_BR
Aparece nas coleções:Teses, dissertações e produtos pós-doutorado

Mostrar registro simples do item Visualizar estatísticas



Os itens no repositório estão protegidos por copyright, com todos os direitos reservados, salvo quando é indicado o contrário.