Heurísticas para desambiguação incremental de nomes de autores em referências bibliográficas

Carregando...
Imagem de Miniatura

Título da Revista

ISSN da Revista

Título de Volume

Editor

Universidade Federal de Minas Gerais

Descrição

Tipo

Dissertação de mestrado

Título alternativo

Primeiro orientador

Membros da banca

Anderson Almeida Ferreira
Clodoveu Augusto Davis Junior
Ricardo da Silva Torres

Resumo

A ambiguidade de nomes de autores em referencias bibliográficas é um dos principais problemas que afetam a qualidade dos servidos oferecidos pelas bibliotecas digitais. Nos últimos anos, inúmeros métodos automáticos de desambiguação de nomes em referências bibliográficas foram propostos baseados em diferentes abordagens supervisionadas e não supervisionadas. Entretanto, poucos foram desenvolvidos com o objetivo de permitir a desambiguação das citações no momento em que elas são incluídas no repositório de uma biblioteca digital. Em um cenário real, estas soluções são potencialmente mais práticas e eficientes, uma vez que evitam a necessidade de reprocessar todo repositório sempre que novas citações são incluídas no banco de dados. Neste trabalho é proposto um novo método de desambiguação incremental baseado em heurísticas, capaz de criar e atualizar automaticamente um conjunto de treinamento utilizado para determinar os autores de cada citação. Este método foi avaliado em diferentes cenários de aplicação e comparado com várias soluções encontradas na literatura. Na avaliação experimental, foram obtidos ganhos significativos em todas as coleções utilizadas em relação aos melhores baselines supervisionados e não-supervisionados. Também foram realizados experimentos a fim de demonstrar a praticidade e eficiência do método ao realizar a desambiguação de coleções de forma incremental.

Abstract

The ambiguity of author name in bibliographic references is one of the main problems affecting the quality of services offered by digital libraries. In recent years, numerous methods for automatic name disambiguation have been proposed based on different supervised and unsupervised approaches. However, just a few have been developed in order to allow the disambiguation at the time that citations are incorporated into the digital library. In a real situation, these solutions are potentially more efficient and practical, since they avoid the need to reprocess the entire repository whenever new citations are included in the database. This paper proposes a new incremental disambiguation method based on heuristics, able to automatically create and update a training set used to determine the author of each reference. This method was evaluated in different application scenarios and compared with several solutions found in the literature. In the experimental evaluation, our solution has achieved significant gains in all collections when compared with the best supervised and unsupervised baselines. We also performed experiments to demonstrate the practicability and efficiency of the method when used in a incremental way.

Assunto

Bibliotecas digitais, Computação, Programação heurística , Referencias bibliograficas, Ambigüidade

Palavras-chave

Bibliotecas digitais, Referências bibliográficas, Heurísticas, Ambiguidade de nomes

Citação

Departamento

Curso

Endereço externo

Avaliação

Revisão

Suplementado Por

Referenciado Por