Characterization of automated machine learning fitness landscapes

Cristiano Guimarães Pimenta

Please use this identifier to cite or link to this item: http://hdl.handle.net/1843/62093

Full metadata record

DC Field	Value	Language
dc.contributor.advisor1	Gisele Lobo Pappa	pt_BR
dc.contributor.advisor1Lattes	http://lattes.cnpq.br/5936682335701497	pt_BR
dc.contributor.advisor-co1	Alex Guimarães Cardoso de Sá	pt_BR
dc.contributor.referee1	Renato Vimieiro	pt_BR
dc.contributor.referee2	Ricardo Bastos Cavalcante Prudêncio	pt_BR
dc.creator	Cristiano Guimarães Pimenta	pt_BR
dc.creator.Lattes	http://lattes.cnpq.br/8713326153602094	pt_BR
dc.date.accessioned	2023-12-19T20:53:28Z	-
dc.date.available	2023-12-19T20:53:28Z	-
dc.date.issued	2023-06-21	-
dc.identifier.uri	http://hdl.handle.net/1843/62093	-
dc.description.abstract	Aprendizado de Máquina Automatizado (AutoML) tem o objetivo de selecionar e configurar pipelines de aprendizado de máquina automaticamente, sem exigir conhecimentos profundos do usuário. Métodos de AutoML utilizam um espaço de busca que contém possíveis soluções e tentam encontrar o melhor pipeline para um problema de aprendizado específico. Entretanto, pouco se sabe sobre quais são as características desses espaços de busca e como elas afetam o desempenho de métodos de busca. Uma forma de descrever os espaços de busca é por meio de Análise de Fitness Landscape (FLA), uma técnica muito utilizada para descrever o espaço de busca de problemas de otimização combinatória. O presente trabalho adapta métricas clássicas de FLA, tais como Neutralidade, Correlação de Distância de Fitness (FDC) e Distância de Correlação ao contexto de AutoML, cujos espaços de busca são complexos, uma vez que contêm variáveis discretas, contínuas, categóricas e condicionais, de forma totalmente independente do método de busca utilizado para explorar o espaço. Além disso, é feita uma avaliação de como as características do espaço de busca afetam o desempenho de dois métodos de busca baseados em otimização Bayesiana: Tree-structured Parzen Estimator (TPE) e Sequential Model-based Algorithm Configuration (SMAC). De forma a utilizar FLA no contexto de AutoML, nós propomos uma representação em árvore para os pipelines de aprendizado de máquina capaz de capturar sua semântica, uma definição de vizinhança baseada em um operador de mutação e uma medida semântica de distância entre pipelines. Análises de Neutralidade sugerem que espaços de busca maiores tendem a ter mais áreas com valores iguais, ou quase iguais, de fitness, uma característica que pode melhorar a habilidade do TPE de explorar o espaço e encontrar boas soluções. Espaços de busca maiores tendem a ser mais enrugados, de acordo com a métrica de Distância de Correlação, e normalmente são mais difíceis para os otimizadores. FDC se mostrou uma métrica pouco informativa em relação à dificuldade do problema de encontrar o melhor pipeline de aprendizado de máquina. Além disso, a utilização de ótimos locais para calcular a métrica pode levar a resultados bastante diferentes em comparação ao uso do ótimo global, cujo cálculo é normalmente inviável para problemas de AutoML. Por outro lado, desempenho do otimizador SMAC se mostrou menos afetado por alterações nas características do espaço, quando comparado ao TPE.	pt_BR
dc.description.resumo	Automated Machine Learning (AutoML) aims at automatically selecting and configuring complete machine learning pipelines without requiring deep user expertise. AutoML methods utilize a search space of possible solutions and try to find the best pipeline for a given learning problem. However, there is little knowledge about the characteristics of such spaces and how they relate to the performance of search methods. One way of exploring them is using Fitness Landscape Analysis (FLA), a technique commonly used to describe the landscape of combinatorial optimization problems. This work adapts classic FLA measures, such as Neutrality, Fitness Distance Correlation (FDC) and Correlation Length, to the context of the complex fitness landscape generated by AutoML search spaces, which include discrete, continuous, categorical and conditional variables, regardless of the methods used to explore the search spaces. It also evaluates how the characteristics of the landscape affect the performance of two AutoML methods based on Bayesian optimization: Tree-structured Parzen Estimator (TPE) and Sequential Model-based Algorithm Configuration (SMAC). In order to use FLA in the context of AutoML, we propose a tree-based representation for machine learning pipelines that is able to capture their semantics, a neighborhood definition based on a mutation operator, and a semantic distance metric between pipelines. Neutrality analyses suggest that larger landscapes tend to have more areas of equal or nearly equal fitness values, a feature that can improve the ability of TPE to explore the search space and find good solutions. Larger search spaces tend to be more rugged, as indicated by the Correlation Length measure, and are often more challenging for the optimizers. FDC proved to be a weak measure in describing problem difficulty. Furthermore, using local optima to calculate FDC can lead to very different results when compared to using the global optimum, which is usually unfeasible to calculate for AutoML problems. On the other hand, SMAC’s performance seems less affected by changes in the characteristics of the landscape.	pt_BR
dc.description.sponsorship	FAPEMIG - Fundação de Amparo à Pesquisa do Estado de Minas Gerais	pt_BR
dc.description.sponsorship	CAPES - Coordenação de Aperfeiçoamento de Pessoal de Nível Superior	pt_BR
dc.language	eng	pt_BR
dc.publisher	Universidade Federal de Minas Gerais	pt_BR
dc.publisher.country	Brasil	pt_BR
dc.publisher.department	ICX - DEPARTAMENTO DE CIÊNCIA DA COMPUTAÇÃO	pt_BR
dc.publisher.program	Programa de Pós-Graduação em Ciência da Computação	pt_BR
dc.publisher.initials	UFMG	pt_BR
dc.rights	Acesso Aberto	pt_BR
dc.subject	Fitness landscape analysis	pt_BR
dc.subject	Automated machine learning	pt_BR
dc.subject	Search spaces	pt_BR
dc.subject	Optimization	pt_BR
dc.subject.other	Computação – Teses	pt_BR
dc.subject.other	Aprendizado do computador – Teses	pt_BR
dc.subject.other	Otimização combinatória - Teses	pt_BR
dc.subject.other	Fitness landscape – Teses	pt_BR
dc.title	Characterization of automated machine learning fitness landscapes	pt_BR
dc.type	Dissertação	pt_BR
dc.identifier.orcid	https://orcid.org/0000-0003-2809-8663	pt_BR
Appears in Collections:	Dissertações de Mestrado

Files in This Item:

File	Description	Size	Format
Dissertation_Cristiano_G_Pimenta.pdf		11.85 MB	Adobe PDF	View/Open

Show simple item record