Mining large amount of short text data in your desktop

Larissa Sayuri Futino Castro dos Santos

Please use this identifier to cite or link to this item: http://hdl.handle.net/1843/33568

Full metadata record

DC Field	Value	Language
dc.contributor.advisor1	Marcos Oliveira Prates	pt_BR
dc.contributor.advisor1Lattes	http://lattes.cnpq.br/7893235207392165	pt_BR
dc.contributor.advisor-co1	Michael Oakes	pt_BR
dc.contributor.referee1	Rafael Bassi Stern	pt_BR
dc.contributor.referee2	Clécio da Silva Ferreira	pt_BR
dc.contributor.referee3	Marcelo Azevedo Costa	pt_BR
dc.contributor.referee4	Ilka Afonso Reis	pt_BR
dc.creator	Larissa Sayuri Futino Castro dos Santos	pt_BR
dc.creator.Lattes	http://lattes.cnpq.br/3092604714336640	pt_BR
dc.date.accessioned	2020-05-29T19:05:56Z	-
dc.date.available	2020-05-29T19:05:56Z	-
dc.date.issued	2019-06-27	-
dc.identifier.uri	http://hdl.handle.net/1843/33568	-
dc.description.abstract	Problemas de classificação/categorização de texto tornam-se ainda mais desafiadores quando os documentos de interesse são curtos. Além da falta de contexto, texto advindos da web tem o agravante da espontaneidade, flexibilidade e informalidade. Esse trabalho propõe uma metodologia que viabilize a indução de classificadores de texto para bases de dados grandes por usuários com disponibilidade de computadores comuns e sem conhecimento avançado em computação paralela e/ou distribuída. A metodologia proposta divide-se em dois passos. No primeiro deles, como etapa inicial, procede-se com a partição do banco de dados em subconjuntos de dados menores. No segundo passo cada subconjunto induz um classificador específico a partir de uma técnica supervisionada de Aprendizado de Máquina. A indução de um classificador com a coleção completa é substituída por induções de classificadores com menos dados o que reduz o esforço computacional. Além disso, viabiliza-se também a indução de múltiplos classificadores em distintos cores do computador concomitantemente. Isso denota uma paralelização computacional simples, o que reduz o tempo de processamento para a execução da tarefa. A metodologia também permite o emprego de distintas formas de representação do texto (o uso do vocabulário observado, com diferentes formas de seleção de atributos, o uso de anotação, bigramas, etc). Também é possível o uso de diferentes técnicas de agrupamento e Aprendizado de Máquina. Tais técnicas podem ser especificadas de acordo com as preferências do usuário, contexto e dificuldades do problema ou infra-estrutura disponível. Experimentos com distintos tipo de técnicas de classificação são realizadas. Apresentam-se análises para um base de tweets coletados na região de São Paulo-SP, Brasil no tópico de crime. A eficiência da metodologia é comprovada com o seu emprego em uma base de dados de 1.600.000 tweets em inglês, no domínio de Análise de Sentimento.	pt_BR
dc.description.resumo	This work describes the classification of texts as being either crime-related or non-crime-related. Given the spontaneity and popularity of Twitter, we collected some posts related to crime and criminology, in the state of São Paulo-SP Brazil. However, this data set is not a collection of crime reports. As the web language is characterized by diversity including flexibility, spontaneity and informality we need a classification rule to filter the documents which really are in the context. The proposed methodology works in a two-step framework. In the first step, we partition the text database into smaller data sets which define text collections with characteristics (not necessarily directly observable) which allow a better classification process. This enables the usage of parallel computing which decreases the time process required for the technique execution. Later on, each subset of the data induces a distinct classification rule with a Supervised Machine Learning technique. For the sake of simplicity, we work with KMeans and KMedoids and linear SVM. We will present our results in terms of speed and classification accuracy using various feature sets, including semantic codes. Analysis with distinct classifier induction techniques as Random Forest, Logistic Regression, and Boosting is also provided. An application with a huge data set of 1,600,000 tweets written in English proofs the method's efficiency.	pt_BR
dc.description.sponsorship	CAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superior	pt_BR
dc.language	eng	pt_BR
dc.publisher	Universidade Federal de Minas Gerais	pt_BR
dc.publisher.country	Brasil	pt_BR
dc.publisher.department	ICX - DEPARTAMENTO DE ESTATÍSTICA	pt_BR
dc.publisher.program	Programa de Pós-Graduação em Estatística	pt_BR
dc.publisher.initials	UFMG	pt_BR
dc.rights	Acesso Aberto	pt_BR
dc.subject	text classification	pt_BR
dc.subject	machine learning	pt_BR
dc.subject	partition clustering	pt_BR
dc.subject	feature selection	pt_BR
dc.subject	edit distance	pt_BR
dc.subject.other	Estatística – Teses	pt_BR
dc.subject.other	Análise por conglomerados	pt_BR
dc.subject.other	Mineração de dados (Computação)	pt_BR
dc.subject.other	Classificação de Textos	pt_BR
dc.subject.other	Aprendizado do computador	pt_BR
dc.title	Mining large amount of short text data in your desktop	pt_BR
dc.title.alternative	Minerando grandes bases de textos curtos em um desktop comum	pt_BR
dc.type	Tese	pt_BR
Appears in Collections:	Teses de Doutorado

Files in This Item:

File	Description	Size	Format
LarissaSayuriFutinoCastroDosSantosFinal.pdf		5.67 MB	Adobe PDF	View/Open

Show simple item record