Please use this identifier to cite or link to this item: https://hdl.handle.net/10216/68734
Full metadata record
DC FieldValueLanguage
dc.creatorNuno Pinto Hespanhol Lopes dos Santos
dc.date.accessioned2025-11-09T11:17:24Z-
dc.date.available2025-11-09T11:17:24Z-
dc.date.issued2013-07-12
dc.date.submitted2013-09-14
dc.identifier.othersigarra:27386
dc.identifier.urihttps://hdl.handle.net/10216/68734-
dc.descriptionModern society has drastically changed the way it consumes music. During these last recent years, listeners have become more demanding in how many songs they want to have accessible and require to access them faster than ever before. The modern listener got used to features like automatic music recommendation and searching for songs that, for example, have female vocals'' and ambient'' characteristics. This has only been possible due to sophisticated autotagging algorithms. However, there has been an increasing belief in the research community that these algorithms often report over optimistic results. This work approaches this issue, in the context of automatic vocal detection, using evaluation methods that are rarely seen in literature. Three methods are conducted for the evaluation of the classification model developed: same dataset validation, cross dataset validation and filtering. The cross dataset experiment shows that the concept of vocals is generally specific per dataset rather than universal as expected. The filtering experiment, which consists of iteratively applying a random filterbank, shows drastic performance drops, in some cases, from a global f-score of 0.72 to 0.27. However, these filters have been showed not to affect the human ear's ability to distinguish vocals, by conducting a listening experiment with over 150 candidates. Additionally, a comparison between two binarization algorithms - maximum and dynamic threshold - is performed and shows no significance difference. The results are reported on three datasets that have been widely used within the research community, on which a mapping from its original tags to the vocals domain was performed and which is made available to other researchers.
dc.description.abstractA sociedade moderna mudou drasticamente a maneira como consome música. Durante estes últimos anos, os ouvintes tornaram-se mais exigentes em relação ao número de músicas que querem ter acessíveis e querem acedê-las mais rapidamente do que sempre. O ouvinte moderno habituou-se a funcionalidades como recomendação automática de música e a possibilidade de pesquisar músicas com características, como por exemplo, female vocals'' e ambient''. Este tipo de funcionalidades só foram tornadas realidade devido a sofisticados algoritmos de autotagging. Contudo, existe uma crença pela comunidade de investigação que estes algoritmos reportam muitas vezes resultados demasiadamente otimistas. Este trabalho aborda este problema, no contexto de deteção automática de voz, usando métodos de avaliação raramente vistos na literatura. Três métodos são conduzidos para a avaliação do modelo de classificação desenvolvido: validação entre o mesmo dataset, validação entre datasets e filtros. A avaliação entre datasets mostra que o conceito de vocais é de uma maneira geral específico por dataset em vez de universal, como seria de esperar. A experiência dos filtros, que consiste em iterativamente aplicar um \emph{filterbank} aleatório, mostra drásticas baixas na performance, em alguns casos, de um f-score global de 0.72 para 0.27. Contudo, estes filtros são mostrados que não afectam a capacidade do ouvido humana de distinguir vocais, através da condução de uma experiência perceptiva com mais de 150 candidatos. Adicionalmente, é realizada também uma comparação entre dois métodos de binarização - máximo e limite dinâmico - que não mostra uma diferença significativa entre eles. Os resultados são reportados em três datasets que foram largamente utilizados pela comunidade de investigação, sobre os quais é realizado um mapeamento das suas tags originais para o domínio vocals e que é posto disponível para outros investigadores.
dc.language.isoeng
dc.rightsopenAccess
dc.rights.urihttps://creativecommons.org/licenses/by-nc/4.0/
dc.subjectEngenharia electrotécnica, electrónica e informática
dc.subjectElectrical engineering, Electronic engineering, Information engineering
dc.titleUsing Autotagging for Classification of Vocals in Music Signals
dc.typeDissertação
dc.contributor.uportoFaculdade de Engenharia
dc.identifier.doi10.34626/qmje-dz52
dc.identifier.tid201315432
dc.subject.fosCiências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática
dc.subject.fosEngineering and technology::Electrical engineering, Electronic engineering, Information engineering
thesis.degree.disciplineMestrado Integrado em Engenharia Informática e Computação
thesis.degree.grantorFaculdade de Engenharia
thesis.degree.grantorUniversidade do Porto
thesis.degree.level1
Appears in Collections:FEUP - Dissertação

Files in This Item:
File Description SizeFormat 
27386.pdfUsing Autotagging for Classification of Vocals in Music Signals1.85 MBAdobe PDFThumbnail
View/Open


This item is licensed under a Creative Commons License Creative Commons