Back to results

Universidade Federal de Pernambuco

Algoritmos de seleção de características personalizados por classe para categorização de texto

Abstract

dc:description.abstract

A categorização de textos é uma importante ferramenta para organização e recuperação de informações em documentos digitais. Uma abordagem comum é representar cada palavra como uma característica. Entretanto, a maior parte das características em um documento textual são irrelevantes para sua categorização. Assim, a redução de dimensionalidade é um passo fundamental para melhorar o desempenho de classificação e reduzir o alto custo computacional inerente a problemas de alta dimensionalidade, como é o caso da categorização de textos. A estratégia mais utilizada para redução de dimensionalidade em categorização de textos passa por métodos de seleção de características baseados em filtragem. Métodos deste tipo exigem um esforço para configurar o tamanho do vetor final de características. Este trabalho propõe métodos de filtragem com o intuito melhorar o desempenho de classificação em comparação com os métodos atuais e de tornar possível a automatização da escolha do tamanho do vetor final de características. O primeiro método proposto, chamado Category-dependent Maximum f Features per Document-Reduced (cMFDR), define um limiar para cada categoria para determinar quais documentos serão considerados no processo de seleção de características. O método utiliza um parâmetro para definir quantas características são selecionadas por documento. Esta abordagem apresenta algumas vantagens, como a simplificação do processo de escolha do subconjunto mais efetivo através de uma drástica redução da quantidade de possíveis configurações. O segundo método proposto, Automatic Feature Subsets Analyzer (AFSA), introduz um procedimento para determinar, de maneira guiada por dados, o melhor subconjunto de características dentre um número de subconjuntos gerados. Este método utiliza o mesmo parâmetro usado por cMFDR para definir a quantidade de características no vetor final. Isto permite que a busca pelo melhor subconjunto tenha um baixo custo computacional. O desempenho dos métodos propostos foram avaliados nas bases de dados WebKB, Reuters, 20 Newsgroup e TDT2, utilizando as funções de avaliação de características Bi-Normal Separation, Class Discriminating Measure e Chi-Squared Statistics. Os resultados dos experimentos demonstraram uma maior efetividade dos métodos propostos em relação aos métodos do estado da arte.

Degree

thesis:*
Grantor dc:publisher
Universidade Federal de Pernambuco
Year dc:date.issued
2016

Author and committee

dc:creator, dc:contributor.*
Author dc:creator
  • FRAGOSO, Rogério César Peixoto
Advisor dc:contributor.advisor
  • CAVALCANTI, George Darmiton da Cunha

Subjects

dc:subject × 2

Rights

dc:rights
Statement dc:rights
  • openAccess
  • Attribution-NonCommercial-NoDerivs 3.0 Brazil
Language dc:language.iso
por

Identifiers

dc:identifier.*
Repository record dc:identifier.uri
https://repositorio.ufpe.br/handle/123456789/21130
OAI identifier oai:identifier
oai:repositorio.ufpe.br:123456789/21130

Chain of custody

source
Harvested from
Brazil UFPE
Base URL
repositorio.ufpe.br/oai/request
Last updated
2026-07-24
Source record
OAI-PMH GetRecord
citation

FRAGOSO, Rogério César Peixoto. Algoritmos de seleção de características personalizados por classe para categorização de texto. Universidade Federal de Pernambuco, 2016. https://repositorio.ufpe.br/handle/123456789/21130