Back to search

Universidade do Minho

Closed-loop metrics-based dataset optimization toward deep learning models

Abstract

dc:description.abstract

Os avanços tecnológicos permitiram a exploração prática de conceitos de artificial neural network propostos na década de 1980, conduzindo a progressos significativos na visão por computador, particularmente através das Convolutional Neural Networks (CNNs). No entanto, o desempenho das CNNs depende fortemente da qualidade e diversidade dos dados. Neste contexto, têm sido propostas estratégias centradas nos dados para explorar todo o potencial de inferência dos modelos, abrangendo desde etapas iniciais de divisão e aumento de conjuntos de dados até procedimentos de avaliação posteriores, como a K-Fold Cross Validation (KFCV) . Apesar da sua adoção generalizada, algumas limitações podem ser identificadas nestas práticas padronizadas. Por um lado, os procedimentos de divisão e aumento de conjuntos de dados são tipicamente realizados sem considerar as respetivas características intrínsecas, com implicações para a representatividade inerentemente ligada a situações como padrões raros de ocorrências ou combinações específicas de primeiro plano e fundo. Por outro lado, embora técnicas baseadas em KFCV sejam geralmente eficazes, a sua natureza iterativa torna-as computacionalmente dispendiosas e temporalmente exigentes. Motivado por estes desafios, o presente trabalho investiga a engenharia e otimização de conjuntos de dados como forma de melhorar e, simultaneamente, tornar mais eficiente o treino de CNNs. Para tal, são propostas duas abordagens complementares. A primeira, inspirada em princípios de aprendizagem não supervisionada, realiza uma análise da distribuição de características intrínsecas dos dados antes do treino, permitindo uma divisão equilibrada dos dados numa única etapa de curta duração. A segunda introduz uma estratégia em malha fechada, baseada em reforço e aplicada durante o treino, que reamostra seletivamente classes sub-representadas enquanto monitoriza métricas-chave para mitigar a sobre-amostragem e a degradação do modelo. Para avaliar a robustez e capacidade de generalização, foram utilizados dois conjuntos de dados específicos de domínio: um relativo à classificação de variedades de folhas de videira e outro focado na deteção de defeitos em pontes. Os resultados mostram que a divisão de dados informada pelas características oferece uma alternativa eficiente aos métodos tradicionais. Além disso, a estratégia de reamostragem orientada por métricas, implementada num esquema de malha fechada, demonstrou ser eficaz na melhoria consistente do desempenho das CNNs, reforçando a representatividade das classes sem promover sobreajuste.

Degree

thesis:*
Name thesis:degree_name
Doutoramento em Informática
Grantor
Universidade do Minho
Year dc:date.issued
2026

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • Shahrabadi, Somayeh
Advisors dc:contributor.advisor
  • Alves, Victor
  • Adão, Telmo Miguel Oliveira

Subjects

dc:subject × 6

Rights

dc:rights
Statement dc:rights
  • openAccess
Language dc:language.iso
eng

Identifiers

dc:identifier.*
Handle dc:identifier.uri
https://hdl.handle.net/1822/101342

Chain of custody

source
Harvested from
Universidade do Minho
Base URL
repositorium.sdum.uminho.pt/oai/request
Last updated
2026-08-21
Source record
OAI-PMH GetRecord
citation

Shahrabadi, Somayeh. Closed-loop metrics-based dataset optimization toward deep learning models. Universidade do Minho, 2026. https://hdl.handle.net/1822/101342