Mining large amount of short text data in your desktop

Larissa Sayuri Futino Castro dos Santos

Please use this identifier to cite or link to this item: http://hdl.handle.net/1843/33568

Type:	Tese
Title:	Mining large amount of short text data in your desktop
Other Titles:	Minerando grandes bases de textos curtos em um desktop comum
Authors:	Larissa Sayuri Futino Castro dos Santos
First Advisor:	Marcos Oliveira Prates
First Co-advisor:	Michael Oakes
First Referee:	Rafael Bassi Stern
Second Referee:	Clécio da Silva Ferreira
Third Referee:	Marcelo Azevedo Costa
metadata.dc.contributor.referee4:	Ilka Afonso Reis
Abstract:	This work describes the classification of texts as being either crime-related or non-crime-related. Given the spontaneity and popularity of Twitter, we collected some posts related to crime and criminology, in the state of São Paulo-SP Brazil. However, this data set is not a collection of crime reports. As the web language is characterized by diversity including flexibility, spontaneity and informality we need a classification rule to filter the documents which really are in the context. The proposed methodology works in a two-step framework. In the first step, we partition the text database into smaller data sets which define text collections with characteristics (not necessarily directly observable) which allow a better classification process. This enables the usage of parallel computing which decreases the time process required for the technique execution. Later on, each subset of the data induces a distinct classification rule with a Supervised Machine Learning technique. For the sake of simplicity, we work with KMeans and KMedoids and linear SVM. We will present our results in terms of speed and classification accuracy using various feature sets, including semantic codes. Analysis with distinct classifier induction techniques as Random Forest, Logistic Regression, and Boosting is also provided. An application with a huge data set of 1,600,000 tweets written in English proofs the method's efficiency.
Abstract:	Problemas de classificação/categorização de texto tornam-se ainda mais desafiadores quando os documentos de interesse são curtos. Além da falta de contexto, texto advindos da web tem o agravante da espontaneidade, flexibilidade e informalidade. Esse trabalho propõe uma metodologia que viabilize a indução de classificadores de texto para bases de dados grandes por usuários com disponibilidade de computadores comuns e sem conhecimento avançado em computação paralela e/ou distribuída. A metodologia proposta divide-se em dois passos. No primeiro deles, como etapa inicial, procede-se com a partição do banco de dados em subconjuntos de dados menores. No segundo passo cada subconjunto induz um classificador específico a partir de uma técnica supervisionada de Aprendizado de Máquina. A indução de um classificador com a coleção completa é substituída por induções de classificadores com menos dados o que reduz o esforço computacional. Além disso, viabiliza-se também a indução de múltiplos classificadores em distintos cores do computador concomitantemente. Isso denota uma paralelização computacional simples, o que reduz o tempo de processamento para a execução da tarefa. A metodologia também permite o emprego de distintas formas de representação do texto (o uso do vocabulário observado, com diferentes formas de seleção de atributos, o uso de anotação, bigramas, etc). Também é possível o uso de diferentes técnicas de agrupamento e Aprendizado de Máquina. Tais técnicas podem ser especificadas de acordo com as preferências do usuário, contexto e dificuldades do problema ou infra-estrutura disponível. Experimentos com distintos tipo de técnicas de classificação são realizadas. Apresentam-se análises para um base de tweets coletados na região de São Paulo-SP, Brasil no tópico de crime. A eficiência da metodologia é comprovada com o seu emprego em uma base de dados de 1.600.000 tweets em inglês, no domínio de Análise de Sentimento.
Subject:	Estatística – Teses Análise por conglomerados Mineração de dados (Computação) Classificação de Textos Aprendizado do computador
language:	eng
metadata.dc.publisher.country:	Brasil
Publisher:	Universidade Federal de Minas Gerais
Publisher Initials:	UFMG
metadata.dc.publisher.department:	ICX - DEPARTAMENTO DE ESTATÍSTICA
metadata.dc.publisher.program:	Programa de Pós-Graduação em Estatística
Rights:	Acesso Aberto
URI:	http://hdl.handle.net/1843/33568
Issue Date:	27-Jun-2019
Appears in Collections:	Teses de Doutorado

Files in This Item:

File	Description	Size	Format
LarissaSayuriFutinoCastroDosSantosFinal.pdf		5.67 MB	Adobe PDF	View/Open

Show full item record