Use este identificador para citar o ir al link de este elemento: http://hdl.handle.net/1843/50516
Tipo: Dissertação
Título: Uma metodologia prática para testar o critério do custo de complexidade ao podar árvores de regressão
Autor(es): Heitor Blesa Farias
primer Tutor: Cristiano Mauro Assis Gomes
primer miembro del tribunal : Vithor Rosa Franco
Segundo miembro del tribunal: Maicon Rodrigues Albuquerque
Resumen: O método de árvore é uma abordagem bem estabelecida em aprendizado de máquina. A maioria de seus algoritmos constroem uma árvore inicial para a previsão de um determinado resultado e depois "podam" essa árvore como forma de minimizar o overfitting. O critério custo de complexidade é provavelmente o mais utilizado para poda, pois é um critério objetivo para definir o ponto na árvore onde a previsão é a melhor possível, levando em consideração a capacidade preditiva do modelo em outras amostras da população. Pesquisadores têm usado esse critério para realizar a poda da árvore de regressão com base nas recomendações da literatura de que esse é um bom critério. No entanto, não existe uma metodologia em que o pesquisador seja capaz de avaliar a eficácia desse critério para gerar uma árvore empírica com poda adequada, ou seja, uma árvore que não tenha overfitting e que encontre a melhor previsão possível para outras amostras da população. Considerando a relevância das técnicas de regressão de árvores para predição e a necessidade de poda dessas árvores para lidar com o problema de overfitting, é necessário desenvolver uma metodologia que permita ao pesquisador avaliar se o critério custo de complexidade é adequado, tomando como referência a sua própria árvore empírica podada. Esta dissertação tem como objetivo desenvolver uma metodologia prática para avaliar a adequação do critério custo de complexidade para poda de árvores de regressão. A dissertação é composta por dois artigos. O estudo um é uma simulação que apresenta evidências iniciais de que o critério de custo de complexidade é sensível ao tamanho da amostra e gera árvores podadas inadequadamente dependendo do tamanho dessas amostras. Devido a essa inadequação, é necessário testar se a poda pelo critério de custo de complexidade é adequada para um dado empírico. No estudo dois, apresenta-se de forma didática o problema do critério custo da complexidade, bem como a metodologia desenvolvida para verificar a adequação deste critério. Neste estudo, também é apresentado um exemplo de como implementar a metodologia e sua avaliação via simulação.
Abstract: The tree method is a well-established approach in machine learning. Most of its algorithms build an initial tree for the prediction of a given outcome and then "prune" this tree as a way to minimize overfitting. The cost of complexity criterion is probably the most used for pruning, because it is an objective criterion to define the point in the tree where the prediction is the best possible, taking into account the predictive ability of the model in other samples of the population. Researchers have used this criterion to perform regression tree pruning based on literature recommendations that this is a good criterion. However, there is no methodology in which the researcher is able to assess the effectiveness of this criterion to generate an empirical tree with adequate pruning, that is, a tree that does not have overfitting and that finds the best possible prediction for other samples of the population. Considering the relevance of tree regression techniques for prediction and the need for pruning these trees to deal with the overfitting problem, it is necessary to develop a methodology that allows the researcher to assess whether the criterion cost of complexity is adequate, taking as reference your own pruned empirical tree. This dissertation aimed to develop a practical methodology to evaluate the adequacy of the cost of complexity criterion for pruning regression trees. The dissertation consists of two articles. Study one is a simulation that presents initial evidence that the complexity cost criterion is sensitive to sample size and generates inadequately pruned trees depending on the size of these samples. Due to this inadequacy, it is necessary to test whether pruning via the complexity cost criterion is adequate for a given empirical data. In study two, the problem of the cost of complexity criterion is presented in a didactic way, as well as the methodology developed to verify the adequacy of this criterion. In this study, an example of how to implement the methodology and its evaluation via simulation is also presented.
Asunto: Psicologia - Teses
Análise de regressão - Teses
Idioma: por
País: Brasil
Editor: Universidade Federal de Minas Gerais
Sigla da Institución: UFMG
Departamento: FAF - DEPARTAMENTO DE PSICOLOGIA
Curso: Programa de Pós-graduação em Psicologia: Cognição e Comportamento
Tipo de acceso: Acesso Aberto
metadata.dc.rights.uri: http://creativecommons.org/licenses/by-nc-nd/3.0/pt/
URI: http://hdl.handle.net/1843/50516
Fecha del documento: 26-ago-2022
Aparece en las colecciones:Dissertações de Mestrado

archivos asociados a este elemento:
archivo Descripción TamañoFormato 
Dissertação - Heitor Blesa Farias.pdf1.31 MBAdobe PDFVisualizar/Abrir


Este elemento está licenciado bajo una Licencia Creative Commons Creative Commons