Generative models for open set image recognition

Marcos Felipe Vendramini Carvalho

Generative models for open set image recognition

Arquivos

Marcos Felipe Vendramini - Revisado 08dez.pdf (4.21 MB)

Data

2021-12-10

Autor(es)

Marcos Felipe Vendramini Carvalho

Editor

Universidade Federal de Minas Gerais

Tipo

Dissertação de mestrado

Título alternativo

Modelos generativos para reconhecimento de imagens em conjunto aberto

Primeiro orientador

Jefersson Alex Dos Santos

Membros da banca

Hugo Neves de Oliveira
Matheus Pinheiro Ferreira
Fabrício Murai Ferreira

Resumo

Image classification methods are usually trained to perform predictions taking into account a predefined group of known classes. Real-world problems, however, may not allow for a full knowledge of the input and label spaces, making failures in recognition a hazard to deep visual learning. Open set recognition methods are characterized by the ability to correctly identify inputs of known and unknown classes. In this context, we propose GeMOS: simple and plug-and-play open set recognition modules that can be attached to pre-trained Deep Neural Networks for visual recognition. The GeMOS framework pairs pre-trained Convolutional Neural Networks with generative models for open set recognition to extract open set scores for each sample, allowing for failure recognition in object recognition tasks. We conduct a thorough evaluation of the proposed method against state-of-the-art open set algorithms. In these tests, different datasets were used, such as in and out of distribution, with the MNIST as in distribution, we reached the F1-score of 0.91 while the best baseline of the referent test reached 0.85, and, for the CIFAR10 as in distribution, we reached the F1-score of 0.93 while the best baseline of the benchmark test reached 0.81. Tests were also performed using the same dataset as in and out of distribution, a more complex case that showed the dependence of the method on the accuracy of pre-trained networks. The results showed that GeMOS competes with more complex and expensive models and in many cases outperforms them. For future work, we initially propose to apply the method to other domains and real-world problems, and to modify the method for other computer vision tasks.

Abstract

Os métodos de classificação de imagens geralmente são treinados para realizar previsões levando em consideração um grupo predefinido de classes conhecidas. Problemas do mundo real, no entanto, podem não permitir um conhecimento completo de todas as entrada e rótulos do espaço, fazendo com que as falhas no reconhecimento seja um problema para o aprendizado visual profundo. Os métodos de reconhecimento de conjunto aberto são caracterizados pela capacidade de identificar corretamente as entradas de classes conhecidas e desconhecidas. Neste contexto, propomos GeMOS: módulos de reconhecimento de conjunto aberto simples que podem ser anexados a Redes Neurais Profundas pré-treinadas para reconhecimento visual. O framework GeMOS emparelha redes neurais convolucionais pré-treinadas com modelos generativos para introduzir o reconhecimento de conjunto aberto através da extração de pontuações para cada amostra, permitindo o reconhecimento de falha em tarefas de reconhecimento de objeto. Conduzimos uma avaliação completa do método proposto em comparação com algoritmos do estado-da-arte de conjunto aberto. Nesses testes foram utilizados diferentes datasets como dentro e fora da distribuição, onde, com o MNIST dentro da distribuição, atingimos o F1-score de 0.91 enquanto o melhor baseline do teste referente atingiu 0.85, e, para o CIFAR10 dentro da distribuição, atingimos o F1-score de 0.93 enquanto o melhor baseline do teste referente atingiu 0.81. Também foram realizados teste utilizando um mesmo dataset como dentro e fora da distribuição, um caso mais complexo que mostrou a dependência do método a acurácia das redes pré treinadas. Os resultados mostraram que o GeMOS compete com modelos mais complexos e caros e em muitos casos os superam. Para os trabalhos futuros propomos inicialmente aplicar o método a outros domínios e a problemas do mundo real, e modificar o método para outras tarefas de visão computacional.

Assunto

Computação – Teses, Visão computacional –Teses, Redes neurais (Computação) – Teses, Reconhecimento de conjunto aberto –Teses.

Palavras-chave

Computer vision, Neural networks, Open set recognition

URI

https://hdl.handle.net/1843/49031

Departamento

ICX - DEPARTAMENTO DE CIÊNCIA DA COMPUTAÇÃO

Curso

Programa de Pós-Graduação em Ciência da Computação

Coleções

Pós-Graduação em Ciência da Computação - Dissertações

Página do item completo

Generative models for open set image recognition

Arquivos

Data

Autor(es)

Título da Revista

ISSN da Revista

Título de Volume

Editor

Descrição

Tipo

Título alternativo

Primeiro orientador

Membros da banca

Resumo

Abstract

Assunto

Palavras-chave

Citação

URI

Departamento

Curso

Endereço externo

Coleções

Avaliação

Revisão

Suplementado Por

Referenciado Por