Please use this identifier to cite or link to this item:
https://hdl.handle.net/10216/166241| Author(s): | Amir Abbas Orouji |
| Title: | Music segmentation analysis in Iberian folk music |
| Issue Date: | 2025-04-08 |
| Abstract: | Music segmentation is one of the fundamental tasks within music information retrieval (MIR). It aims to understand and mimic how our brain understands music and segments it into different structural elements such as beats, meters, phrases, and sections. This work focuses on the automatic phrase segmentation subtask. The models used for phrase segmentation can be divided into three major categories: rule-based, supervised, and unsupervised models. Rule-based models are based on musical rules and how humans perceive music phrases. The second and third categories handle phrase detection as a machine-learning problem and detect the musical phrases by analyzing the pieces as an annotated or unannotated data. Among many statistical and music-theory approaches, the local boundary detection model (LBDM) is a prominent method due to its accuracy and cognitive-basis explainability. It relies on musical changes to shape a novelty curve and find the candidate segments based on pitch intervals, inter-onset intervals, and rest information extracted from symbolic musical surface structure (i.e., scores). An identified limitation of the LBDM algorithm is the lack of repetition awareness in the musical surface structure. To this end, we study the enhancement of the baseline model with structural repetition information resulting from the variational Markov oracle (VMO). A finite-state automaton that can efficiently search for factors (substrings) in a string. Furthermore, we assess optimal weights for each of the surface elements information extracted, using genetic algorithm search heuristic and entropy, which is a measure of information in a desired variable change. To evaluate our models, we adopted a novel dataset of Iberian folk music consisting of 59 Portuguese and 738 Spanish folk pieces in symbolic representation, and we used the commonly used F-measure as our reference metric to assess the effectiveness of our models. Our results show that with a good amount of good-quality data and an optimization algorithm, the LDBM, or any weight-based model, can be optimized and achieve better performance for a specific genre, region, or dataset. Our model, with sufficient training data, managed to increase the overall F-measure of the original LBDM in Spanish folk music from 60% to 67% which is even higher than what has been reported in previous literature. |
| Description: | A segmentação musical é uma das tarefas fundamentais da recuperação de informação musical (MIR). O seu objetivo é compreender e imitar a forma como o nosso cérebro compreende a música e a segmenta em diferentes elementos estruturais, tais como batidas, metros, frases e secções. Este trabalho centra-se na subtarefa de segmentação automática de frases. Os modelos utilizados para a segmentação de frases podem ser divididos em três categorias principais: modelos baseados em regras, supervisionados e não supervisionados. Os modelos baseados em regras baseiam-se em regras musicais e na forma como os humanos percepcionam as frases musicais. A segunda e terceira categorias tratam a deteção de frases como um problema de aprendizagem automática e detectam as frases musicais analisando as peças como dados anotados ou não anotados. Entre muitas abordagens estatísticas e de teoria musical, o modelo de deteção de limites locais (LBDM) é um método proeminente devido à sua exatidão e explicabilidade de base cognitiva. Baseia-se em alterações musicais para moldar uma curva de novidade e encontrar os segmentos candidatos com base em intervalos de altura, intervalos de interconexão e informações de repouso extraídas da estrutura simbólica da superfície musical (ou seja, partituras). Uma limitação identificada do algoritmo LBDM é a falta de consciência da repetição na estrutura da superfície musical. Para este efeito, estudamos a melhoria do modelo de base com informação estrutural de repetição resultante do oráculo variacional de Markov (VMO). Um autómato de estado finito que pode procurar eficientemente factores (substrings) numa cadeia. Além disso, avaliamos os pesos óptimos para cada uma das informações extraídas dos elementos de superfície, utilizando a heurística de pesquisa do algoritmo genético e a entropia, que é uma medida de informação numa mudança de variável desejada. Para avaliar os nossos modelos, adoptámos um novo conjunto de dados de canções folclóricas ibéricas, constituído por 59 canções folclóricas portuguesas e 738 espanholas em representação simbólica, e utilizámos a medida F, normalmente utilizada, como métrica de referência para avaliar a eficácia dos nossos modelos. Os nossos resultados mostram que, com uma boa quantidade de dados de boa qualidade e um algoritmo de otimização, o LDBM, ou qualquer modelo baseado em pesos, pode ser optimizado e alcançar um melhor desempenho para um género, região ou conjunto de dados específico. O nosso modelo, com dados de treino suficientes, conseguiu aumentar a medida F global do LBDM original em canções espanholas de 60% para 67%, o que é ainda mais elevado do que o relatado na literatura anterior. |
| Subject: | Outras ciências da engenharia e tecnologias Other engineering and technologies |
| Scientific areas: | Ciências da engenharia e tecnologias::Outras ciências da engenharia e tecnologias Engineering and technology::Other engineering and technologies |
| DOI: | 10.34626/fp3b-ry46 |
| TID identifier: | 204109582 |
| URI: | https://hdl.handle.net/10216/166241 |
| Document Type: | Dissertação |
| Rights: | openAccess |
| Appears in Collections: | FEUP - Dissertação |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| 717934.pdf | Music segmentation analysis in Iberian folk music | 1.85 MB | Adobe PDF | ![]() View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.
