A Thorough exploitation of distance-based meta-features for Automated text classification

dc.creatorSergio Daniel Carvalho Canuto
dc.date.accessioned2020-08-28T19:39:14Z
dc.date.accessioned2025-09-09T00:04:18Z
dc.date.available2020-08-28T19:39:14Z
dc.date.issued2019-11-22
dc.description.abstractClassificação Automática de Texto (CAT) têm adquirido notória importância em uma variedade de tarefas, como a categorização de notícias, organização de bibliotecas digitais, criação de diretórios da web, análise de sentimentos em conteúdos gerados por usuários e detecção de spam. Dado um conjunto de documentos de treinamento classificados em uma ou mais categorias predefinidas, a tarefa do CAT é aprender automaticamente como classificar novos documentos (não classificados), usando uma combinação de atributos desses documentos que os associam a categorias. Devido ao fato de o problema do CAt ocorrer em vários contextos, diversos algoritmos de aprendizado de máquina foram propostos para lidar com CAT.Embora o próprio algoritmo de classificação tenha um papel importante na CAT, os atributos que representam documentos podem ser igualmente importantes para determinar a eficácia da classificação. Especificamente, representar documentos em um espaço de atributos é um trabalho que precede a CAT, pois esses algoritmos de classificação são projetados para descobrir padrões discriminativos usando esses atributos. Nesse sentido, uma tarefa importante consiste em promover a manipulação espaço de atributos para abordar a CAT do ponto de vista da engenharia de dados. Nesse contexto, abordamos o problema de aprender a classificar textos de forma automática, explorando informações derivadas de meta-atributos, ou seja, atributos criados a partir da representação original dos documentos (bag of words). Particularmente, os meta-atributos explorados contam com medidas de distância capazes de sumarizar relacionamentos potencialmente complexos entre documentos e apresentar informações relevantes para classificação.Neste trabalho, não apenas propomos novos meta-atributos que fornecem evidências discriminativas para classificação, mas também novos mecanismos para analisar e selecionar meta-atributos. sentido, utilizamos estratégias multiobjetivo capazes de minimizar o número de meta-atributos e maximizar a eficácia da classificação, considerando a adequação dos meta-atributos selecionados a uma coleção de dados ou método de classificação específico. Além disso, fornecemos contribuições adicionais para aprimorar a eficiência e a eficácia da utilização de meta-atributos. Em particular, propomos o uso de GPUs (Graphical Processxiing Units) para reduzir o tempo computacional da geração de meta-atributos, o uso de aprendizado supervisionado para o enriquecimento dos relacionamentos de distância com dados rotulados, e a construção de novos meta-atributos específicos para o contexto da análise de sentimento. Nossos resultados experimentais em cinco coleções tradicionalmente usadas na classificação em tópicos mostram que, com as técnicas de seleção apropriadas, nossos metaatributos baseados em distância podem alcançar excelentes resultados de classificação considerando os resultados previamente obtidos no espaço de atributos original ou outros metaatributos baseados em distância recentemente propostos. Além disso, avançamos nossa análise experimental com a identificação e discussão de meta-atributos que, quando combinados, fornecem informações centrais para a classificação de documentos. Aprimoramentos adicionais nesses meta-atributos a partir do enriquecimento dos relacionamentos de distância com informações de rotulação proporcionaram ganhos adicionais sobre nossos melhores resultados obtidos em coleções de classificação em tópicos. Também avaliamos meta-atributos em dezenove coleções de análise de sentimento. Nesse contexto, nossas propostas para classificação de sentimento apresentaram excelentes resultados quando comparados aos metaatributos anteriores que não levam em consideração as idiossincrasias da tarefa de análise de sentimento
dc.description.sponsorshipCAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superior
dc.identifier.urihttps://hdl.handle.net/1843/34071
dc.languageeng
dc.publisherUniversidade Federal de Minas Gerais
dc.rightsAcesso Aberto
dc.subjectComputação – Teses
dc.subjectAprendizado supervisionado.
dc.subjectMeta características
dc.subjectAprendizado de máquina
dc.subject.otherSupervised classification
dc.subject.otherText classification
dc.subject.otherMeta-features
dc.subject.otherMachine learning
dc.titleA Thorough exploitation of distance-based meta-features for Automated text classification
dc.typeTese de doutorado
local.contributor.advisor-co1Thierson Couto Rosa
local.contributor.advisor1Marcos André Gonçalves
local.contributor.advisor1Latteshttp://lattes.cnpq.br/3457219624656691
local.contributor.referee1Gisele Lobo Pappa
local.contributor.referee1Rodrygo Luis Teodoro Santos
local.contributor.referee1Pável Pereira Calado
local.contributor.referee1Alexandre Plastino de Carvalho
local.creator.Latteshttp://lattes.cnpq.br/5172447060300953
local.description.resumoAutomated Text Classification (ATC) has become substantially important for a variety of tasks, such as categorizing news, organizing digital libraries, building web directories, analyzing sentiment of user-generated content and detecting spam, to name a few. Given a set of training documents classified into one or more predefined categories, the task of ATC is to utomatically learn how to classify new (unclassified) documents, using a combination of features of these documents that associates them with categories. Due to the fact that the ATC problem occurs in a number of different applications, diverse machine learning algorithms have been proposed to deal with ATC. Although the classification algorithm itself plays an important role in ATC, the features that represent documents may be equally important to determine effectiveness. In particular, representing documents in a feature space is a prerequisite work for ATC, since these classification algorithms are designed to discover discriminative patterns on these features. In this sense, a relevant challenge relies on efficiently manipulating the feature space to address ATC from a data engineering viewpoint. In this context, we address the problem of automatically learning to classify texts by exploiting information derived from meta-features, i.e., features engineered from the original (bag-of-words) representation. Particularly, the exploited meta-features rely on distance measures to summarize complex relationships between documents and present discriminative information for classification. We here not only propose new meta-features that provide discriminative evidence for classification, but also new mechanisms to analyze and select meta-features using multi-objective strategies. These strategies are capable of reducing the number of meta-features while maximizing the classification effectiveness, when considering the adequacy of the selected meta-features to a particular dataset or classification method. Moreover, we provide additional contributions to improve the efficiency and effectiveness of meta-features. Particularly, we propose: (i) the use of commodity GPUs to reduce the computational time to generate meta-features; (ii) the use of supervised learning to enrich distance relationships with labeled information; and (iii) the design of new specific meta-features for the sentiment analysis context. Our experimental results on five traditional benchmarks for topic classification show that with the appropriate selection techniques, our distance-based meta-features can achieve remarkable classification results considering the results of original feature space and other recently proposed distance-based meta-features. We further explain our results with the identification and discussion about meta-features that, when combined, provide core information to classify documents. Our improvements on core meta-features using labeled information to enrich distance relationships provide additional gains over our best results in topic datasets. We also evaluate meta-features on nineteen sentiment analysis datasets. In this context, our proposals for sentiment classification produced remarkable results considering the effectiveness of previous meta-features that do not take sentiment analysis idiosyncrasies into account.
local.publisher.countryBrasil
local.publisher.initialsUFMG
local.publisher.programPrograma de Pós-Graduação em Ciência da Computação

Arquivos

Pacote original

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
tese_com_ficha (3) (2).pdf
Tamanho:
1.97 MB
Formato:
Adobe Portable Document Format

Licença do pacote

Agora exibindo 1 - 1 de 1
Carregando...
Imagem de Miniatura
Nome:
license.txt
Tamanho:
2.07 KB
Formato:
Plain Text
Descrição: