Please use this identifier to cite or link to this item: http://hdl.handle.net/1843/34071
Full metadata record
DC FieldValueLanguage
dc.contributor.advisor1Marcos André Gonçalvespt_BR
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/3457219624656691pt_BR
dc.contributor.advisor-co1Thierson Couto Rosapt_BR
dc.contributor.referee1Gisele Lobo Pappapt_BR
dc.contributor.referee2Rodrygo Luis Teodoro Santospt_BR
dc.contributor.referee3Pável Pereira Caladopt_BR
dc.contributor.referee4Alexandre Plastino de Carvalhopt_BR
dc.creatorSergio Daniel Carvalho Canutopt_BR
dc.creator.Latteshttp://lattes.cnpq.br/5172447060300953pt_BR
dc.date.accessioned2020-08-28T19:39:14Z-
dc.date.available2020-08-28T19:39:14Z-
dc.date.issued2019-11-22-
dc.identifier.urihttp://hdl.handle.net/1843/34071-
dc.description.abstractClassificação Automática de Texto (CAT) têm adquirido notória importância em uma variedade de tarefas, como a categorização de notícias, organização de bibliotecas digitais, criação de diretórios da web, análise de sentimentos em conteúdos gerados por usuários e detecção de spam. Dado um conjunto de documentos de treinamento classificados em uma ou mais categorias predefinidas, a tarefa do CAT é aprender automaticamente como classificar novos documentos (não classificados), usando uma combinação de atributos desses documentos que os associam a categorias. Devido ao fato de o problema do CAt ocorrer em vários contextos, diversos algoritmos de aprendizado de máquina foram propostos para lidar com CAT.Embora o próprio algoritmo de classificação tenha um papel importante na CAT, os atributos que representam documentos podem ser igualmente importantes para determinar a eficácia da classificação. Especificamente, representar documentos em um espaço de atributos é um trabalho que precede a CAT, pois esses algoritmos de classificação são projetados para descobrir padrões discriminativos usando esses atributos. Nesse sentido, uma tarefa importante consiste em promover a manipulação espaço de atributos para abordar a CAT do ponto de vista da engenharia de dados. Nesse contexto, abordamos o problema de aprender a classificar textos de forma automática, explorando informações derivadas de meta-atributos, ou seja, atributos criados a partir da representação original dos documentos (bag of words). Particularmente, os meta-atributos explorados contam com medidas de distância capazes de sumarizar relacionamentos potencialmente complexos entre documentos e apresentar informações relevantes para classificação.Neste trabalho, não apenas propomos novos meta-atributos que fornecem evidências discriminativas para classificação, mas também novos mecanismos para analisar e selecionar meta-atributos. sentido, utilizamos estratégias multiobjetivo capazes de minimizar o número de meta-atributos e maximizar a eficácia da classificação, considerando a adequação dos meta-atributos selecionados a uma coleção de dados ou método de classificação específico. Além disso, fornecemos contribuições adicionais para aprimorar a eficiência e a eficácia da utilização de meta-atributos. Em particular, propomos o uso de GPUs (Graphical Processxiing Units) para reduzir o tempo computacional da geração de meta-atributos, o uso de aprendizado supervisionado para o enriquecimento dos relacionamentos de distância com dados rotulados, e a construção de novos meta-atributos específicos para o contexto da análise de sentimento. Nossos resultados experimentais em cinco coleções tradicionalmente usadas na classificação em tópicos mostram que, com as técnicas de seleção apropriadas, nossos metaatributos baseados em distância podem alcançar excelentes resultados de classificação considerando os resultados previamente obtidos no espaço de atributos original ou outros metaatributos baseados em distância recentemente propostos. Além disso, avançamos nossa análise experimental com a identificação e discussão de meta-atributos que, quando combinados, fornecem informações centrais para a classificação de documentos. Aprimoramentos adicionais nesses meta-atributos a partir do enriquecimento dos relacionamentos de distância com informações de rotulação proporcionaram ganhos adicionais sobre nossos melhores resultados obtidos em coleções de classificação em tópicos. Também avaliamos meta-atributos em dezenove coleções de análise de sentimento. Nesse contexto, nossas propostas para classificação de sentimento apresentaram excelentes resultados quando comparados aos metaatributos anteriores que não levam em consideração as idiossincrasias da tarefa de análise de sentimentopt_BR
dc.description.resumoAutomated Text Classification (ATC) has become substantially important for a variety of tasks, such as categorizing news, organizing digital libraries, building web directories, analyzing sentiment of user-generated content and detecting spam, to name a few. Given a set of training documents classified into one or more predefined categories, the task of ATC is to utomatically learn how to classify new (unclassified) documents, using a combination of features of these documents that associates them with categories. Due to the fact that the ATC problem occurs in a number of different applications, diverse machine learning algorithms have been proposed to deal with ATC. Although the classification algorithm itself plays an important role in ATC, the features that represent documents may be equally important to determine effectiveness. In particular, representing documents in a feature space is a prerequisite work for ATC, since these classification algorithms are designed to discover discriminative patterns on these features. In this sense, a relevant challenge relies on efficiently manipulating the feature space to address ATC from a data engineering viewpoint. In this context, we address the problem of automatically learning to classify texts by exploiting information derived from meta-features, i.e., features engineered from the original (bag-of-words) representation. Particularly, the exploited meta-features rely on distance measures to summarize complex relationships between documents and present discriminative information for classification. We here not only propose new meta-features that provide discriminative evidence for classification, but also new mechanisms to analyze and select meta-features using multi-objective strategies. These strategies are capable of reducing the number of meta-features while maximizing the classification effectiveness, when considering the adequacy of the selected meta-features to a particular dataset or classification method. Moreover, we provide additional contributions to improve the efficiency and effectiveness of meta-features. Particularly, we propose: (i) the use of commodity GPUs to reduce the computational time to generate meta-features; (ii) the use of supervised learning to enrich distance relationships with labeled information; and (iii) the design of new specific meta-features for the sentiment analysis context. Our experimental results on five traditional benchmarks for topic classification show that with the appropriate selection techniques, our distance-based meta-features can achieve remarkable classification results considering the results of original feature space and other recently proposed distance-based meta-features. We further explain our results with the identification and discussion about meta-features that, when combined, provide core information to classify documents. Our improvements on core meta-features using labeled information to enrich distance relationships provide additional gains over our best results in topic datasets. We also evaluate meta-features on nineteen sentiment analysis datasets. In this context, our proposals for sentiment classification produced remarkable results considering the effectiveness of previous meta-features that do not take sentiment analysis idiosyncrasies into account.pt_BR
dc.description.sponsorshipCAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superiorpt_BR
dc.languageengpt_BR
dc.publisherUniversidade Federal de Minas Geraispt_BR
dc.publisher.countryBrasilpt_BR
dc.publisher.programPrograma de Pós-Graduação em Ciência da Computaçãopt_BR
dc.publisher.initialsUFMGpt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectSupervised classificationpt_BR
dc.subjectText classificationpt_BR
dc.subjectMeta-featurespt_BR
dc.subjectMachine learningpt_BR
dc.subject.otherComputação – Tesespt_BR
dc.subject.otherAprendizado supervisionado.pt_BR
dc.subject.otherMeta característicaspt_BR
dc.subject.otherAprendizado de máquinapt_BR
dc.titleA Thorough exploitation of distance-based meta-features for Automated text classificationpt_BR
dc.typeTesept_BR
Appears in Collections:Teses de Doutorado

Files in This Item:
File Description SizeFormat 
tese_com_ficha (3) (2).pdf2.02 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.