Please use this identifier to cite or link to this item: http://hdl.handle.net/1843/50516
Type: Dissertação
Title: Uma metodologia prática para testar o critério do custo de complexidade ao podar árvores de regressão
Authors: Heitor Blesa Farias
First Advisor: Cristiano Mauro Assis Gomes
First Referee: Vithor Rosa Franco
Second Referee: Maicon Rodrigues Albuquerque
Abstract: O método de árvore é uma abordagem bem estabelecida em aprendizado de máquina. A maioria de seus algoritmos constroem uma árvore inicial para a previsão de um determinado resultado e depois "podam" essa árvore como forma de minimizar o overfitting. O critério custo de complexidade é provavelmente o mais utilizado para poda, pois é um critério objetivo para definir o ponto na árvore onde a previsão é a melhor possível, levando em consideração a capacidade preditiva do modelo em outras amostras da população. Pesquisadores têm usado esse critério para realizar a poda da árvore de regressão com base nas recomendações da literatura de que esse é um bom critério. No entanto, não existe uma metodologia em que o pesquisador seja capaz de avaliar a eficácia desse critério para gerar uma árvore empírica com poda adequada, ou seja, uma árvore que não tenha overfitting e que encontre a melhor previsão possível para outras amostras da população. Considerando a relevância das técnicas de regressão de árvores para predição e a necessidade de poda dessas árvores para lidar com o problema de overfitting, é necessário desenvolver uma metodologia que permita ao pesquisador avaliar se o critério custo de complexidade é adequado, tomando como referência a sua própria árvore empírica podada. Esta dissertação tem como objetivo desenvolver uma metodologia prática para avaliar a adequação do critério custo de complexidade para poda de árvores de regressão. A dissertação é composta por dois artigos. O estudo um é uma simulação que apresenta evidências iniciais de que o critério de custo de complexidade é sensível ao tamanho da amostra e gera árvores podadas inadequadamente dependendo do tamanho dessas amostras. Devido a essa inadequação, é necessário testar se a poda pelo critério de custo de complexidade é adequada para um dado empírico. No estudo dois, apresenta-se de forma didática o problema do critério custo da complexidade, bem como a metodologia desenvolvida para verificar a adequação deste critério. Neste estudo, também é apresentado um exemplo de como implementar a metodologia e sua avaliação via simulação.
Abstract: The tree method is a well-established approach in machine learning. Most of its algorithms build an initial tree for the prediction of a given outcome and then "prune" this tree as a way to minimize overfitting. The cost of complexity criterion is probably the most used for pruning, because it is an objective criterion to define the point in the tree where the prediction is the best possible, taking into account the predictive ability of the model in other samples of the population. Researchers have used this criterion to perform regression tree pruning based on literature recommendations that this is a good criterion. However, there is no methodology in which the researcher is able to assess the effectiveness of this criterion to generate an empirical tree with adequate pruning, that is, a tree that does not have overfitting and that finds the best possible prediction for other samples of the population. Considering the relevance of tree regression techniques for prediction and the need for pruning these trees to deal with the overfitting problem, it is necessary to develop a methodology that allows the researcher to assess whether the criterion cost of complexity is adequate, taking as reference your own pruned empirical tree. This dissertation aimed to develop a practical methodology to evaluate the adequacy of the cost of complexity criterion for pruning regression trees. The dissertation consists of two articles. Study one is a simulation that presents initial evidence that the complexity cost criterion is sensitive to sample size and generates inadequately pruned trees depending on the size of these samples. Due to this inadequacy, it is necessary to test whether pruning via the complexity cost criterion is adequate for a given empirical data. In study two, the problem of the cost of complexity criterion is presented in a didactic way, as well as the methodology developed to verify the adequacy of this criterion. In this study, an example of how to implement the methodology and its evaluation via simulation is also presented.
Subject: Psicologia - Teses
Análise de regressão - Teses
language: por
metadata.dc.publisher.country: Brasil
Publisher: Universidade Federal de Minas Gerais
Publisher Initials: UFMG
metadata.dc.publisher.department: FAF - DEPARTAMENTO DE PSICOLOGIA
metadata.dc.publisher.program: Programa de Pós-graduação em Psicologia: Cognição e Comportamento
Rights: Acesso Aberto
metadata.dc.rights.uri: http://creativecommons.org/licenses/by-nc-nd/3.0/pt/
URI: http://hdl.handle.net/1843/50516
Issue Date: 26-Aug-2022
Appears in Collections:Dissertações de Mestrado

Files in This Item:
File Description SizeFormat 
Dissertação - Heitor Blesa Farias.pdf1.31 MBAdobe PDFView/Open


This item is licensed under a Creative Commons License Creative Commons