Use este identificador para citar o ir al link de este elemento:
http://hdl.handle.net/1843/67493
Tipo: | Dissertação |
Título: | Learning to detect good keypoints to match non-rigid objects in RGB images |
Autor(es): | Welerson Augusto Lino de Jesus Melo |
primer Tutor: | Erickson Rangel do Nascimento |
primer Co-tutor: | Renato José Martins |
primer miembro del tribunal : | William Robson Schwartz |
Segundo miembro del tribunal: | Thiago Luange Gomes |
Tercer miembro del tribunal: | André Filgueiras Araújo |
Resumen: | Keypoint detection, description, and matching are essential component of many computer vision applications. Throughout the years numerous algorithms were proposed to solve keypoint detection and description tasks. With the deep learning “revolution”, learned keypoint detection and description methods surpassed hand-crafted ones. In order to improve matching, joint-learned keypoint detection, and description were proposed. However, these methods intend to improve matching indirectly through the similarity of the descriptors. Because of that, some methods propose to include matching in the training pipeline, but not with true matches of the descriptors they are training, culminating in a low number of correct matches. In addition, methods to detect keypoints are not concerned with non-rigid deformation of objects; therefore, robustness to non-rigid deformations is also a key factor to consider while locating points for visual correspondence. In this work, we claim that a high number of correct matches can be achieved by learning how to detect good keypoints independently of the descriptor method. We present a novel learned keypoint detection method designed to maximize the number of correct matches for the task of non-rigid image correspondence. Our training framework uses true correspondences, obtained by matching annotated image pairs with a predefined descriptor extractor, as a ground-truth to train a convolutional neural network (CNN) in a semisupervised fashion. We optimize the model architecture by applying known geometric transformations to images as the supervisory signal. Experiments show that our method outperforms the state-of-the-art keypoint detector on real images of non-rigid objects by 20 p.p. on Mean Matching Accuracy and also improves the matching performance of several descriptors when coupled with our detection method. We also employ the proposed method in one challenging application: object retrieval, where our detector exhibits performance on par with the best available keypoint detectors. |
Abstract: | Detecção descrição e correspondência de pontos de interesse são componentes essenciais de muitas aplicações de visão computacional. Ao longo dos anos, vários algoritmos foram propostos para resolver tarefas de detecção e descrição de pontos de interesse. Com a revolução do aprendizado profundo, os métodos baseados em algoritmos de aprendizado para detecção e descrição de pontos de interesse superaram os métodos artesanais. A fim de melhorar a correspondência, propomos a detecção e descrição de pontos de interesse aprendidos em conjunto. No entanto, esses métodos pretendem melhorar as correspondências de forma indireta por meio da similaridade dos descritores. Devido a isso, alguns métodos propõem incluir correspondências no pipeline de treinamento, porém não com correspondências verdadeiras dos descritores que estão treinando, culminando em um baixo número de correspondências corretas. Além disso, os métodos para detectar pontos de interesse não se preocupam com a deformação não rígida dos objetos; portanto, a robustez a deformações não rígidas também é um fator chave a ser considerado ao localizar pontos para correspondência visual. Neste trabalho, mostramos que um alto número de correspondências corretas pode ser alcançado aprendendo como detectar bons pontos de interesse independentemente do método descritor. E apresentamos um novo método de aprendizado de máquina para a detecção de ponto-chave projetado para maximizar o número de correspondências corretas para a tarefa de correspondência de imagem não rígida. Nossa estratégia de treinamento usa correspondências verdadeiras, obtidas combinando pares de imagens anotadas com um extrator de descritor predefinido, como groundtruth para treinar uma rede neural convolucional (CNN) de maneira semi-supervisionada. Otimizamos a arquitetura do modelo aplicando transformações geométricas conhecidas às imagens como sinal de supervisão. Experimentos mostram que nosso método supera os detectores de ponto-chave existentes em imagens reais de objetos não rígidos em 20 p.p. na Mean Matching Accuracy e também melhora o desempenho da correspondência de vários descritores quando acoplados ao nosso método de detecçãoao. Também empregamos o método proposto em uma aplicação desafiadora: recuperação de objetos, ao qual o nosso detector apresenta desempenho no mesmo nível dos melhores detectores de ponto-chave disponíveis. |
Asunto: | Computação – Teses Visão por computador – Teses Aprendizado profundo - Teses Detecção de Objetos – Teses |
Idioma: | eng |
País: | Brasil |
Editor: | Universidade Federal de Minas Gerais |
Sigla da Institución: | UFMG |
Departamento: | ICX - DEPARTAMENTO DE CIÊNCIA DA COMPUTAÇÃO |
Curso: | Programa de Pós-Graduação em Ciência da Computação |
Tipo de acceso: | Acesso Aberto |
URI: | http://hdl.handle.net/1843/67493 |
Fecha del documento: | 23-feb-2023 |
Aparece en las colecciones: | Dissertações de Mestrado |
archivos asociados a este elemento:
archivo | Descripción | Tamaño | Formato | |
---|---|---|---|---|
dissertacao_welerson_final_com_ficha_catalografica.pdf | 10.44 MB | Adobe PDF | Visualizar/Abrir |
Los elementos en el repositorio están protegidos por copyright, con todos los derechos reservados, salvo cuando es indicado lo contrario.