Utilize este identificador para referenciar este registo: https://hdl.handle.net/10216/175572
Registo completo
Campo DCValorIdioma
dc.creatorDiogo Filipe Pereira Santos
dc.date.accessioned2026-07-30T01:39:01Z-
dc.date.available2026-07-30T01:39:01Z-
dc.date.issued2026-07-16
dc.date.submitted2026-07-20
dc.identifier.othersigarra:786489
dc.identifier.urihttps://hdl.handle.net/10216/175572-
dc.descriptionOs sistemas de armazenamento distribuído replicam grandes volumes de dados, mas fazem-no sem considerar se todos os itens replicados são igualmente úteis. Ao mesmo tempo, a literatura de ML tem demonstrado que é frequentemente possível alcançar um desempenho comparável no treino de modelos usando menos dados. Esta dissertação insere-se neste contexto, com o objetivo de explorar como a retenção baseada na utilidade estimada dos dados pode ser integrada em sistemas de armazenamento descentralizados, visando reduzir os custos de armazenamento e comunicação, preservando, simultaneamente, a qualidade dos modelos de ML treinados com os dados retidos. O trabalho desenvolvido centrou-se no design de PADME, uma arquitetura orientada à utili- dade para sistemas key-value descentralizados, que integra a retenção probabilística de dados dire- tamente nos protocolos de armazenamento e replicação. Estabelece-se uma base teórica através da revisão de conceitos relevantes de sistemas distribuídos e da análise de um conjunto de técnicas de seleção de subconjuntos, bem como da sua adequação para integração num ambiente distribuído online. Posteriormente, foi desenvolvido um protótipo, o qual foi avaliado em quatro conjuntos de da- dos tabulares que abrangem tarefas de classificação binária, classificação multiclasse e regressão. Os resultados mostram que é possível alcançar reduções substanciais nos dados retidos e no vol- ume de tráfego de replicação sem uma perda proporcional no desempenho dos modelos. Nas tare- fas de classificação binária, a retenção guiada pela utilidade manteve um desempenho competitivo com taxas de retenção tão baixas quanto 1%, reduzindo simultaneamente a carga de replicação em mais de 90%. Estas conclusões sugerem que a integração da redução de dados nos protocolos de armazenamento é uma via promissora para uma gestão de dados distribuída mais eficiente e sustentável.
dc.description.abstractDistributed storage systems replicate large volumes of data, but do so without considering whether all replicated items are equally useful. At the same time, the Machine Learning (ML) literature has shown that comparable model performance can often be achieved with less data. This disser- tation fits into this context, aiming to explore how utility-aware retention can be embedded into decentralised storage systems, with the goal of reducing storage and communication costs while preserving the quality of ML models trained on the retained data. The work developed centred on the design of PADME, a utility-aware architecture for decen- tralised key-value stores that integrates probabilistic data retention directly into storage and repli- cation protocols. A theoretical grounding is established by surveying relevant distributed systems concepts and analysing a group of subset selection techniques and their suitability for integration into an online distributed setting. A prototype was subsequently developed and evaluated on four tabular datasets covering bi- nary classification, multi-class classification, and regression. Results show that substantial reduc- tions in retained data and replication payload can be achieved without a proportional loss in model performance. In binary classification tasks, utility-aware retention maintained competitive perfor- mance at retention ratios as low as 1%, while reducing replication payload by over 90%. These findings suggest that integrating data reduction into storage protocols is a promising direction towards more efficient and sustainable distributed data management.
dc.language.isoeng
dc.rightsopenAccess
dc.subjectEngenharia electrotécnica, electrónica e informática
dc.subjectElectrical engineering, Electronic engineering, Information engineering
dc.titlePADME: Probabilistic Data Management for Efficient ML/AI
dc.typeDissertação
dc.contributor.uportoFaculdade de Engenharia
dc.subject.fosCiências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática
dc.subject.fosEngineering and technology::Electrical engineering, Electronic engineering, Information engineering
thesis.degree.disciplineMestrado em Engenharia Informática e Computação
thesis.degree.grantorFaculdade de Engenharia
thesis.degree.grantorUniversidade do Porto
thesis.degree.level1
Aparece nas coleções:FEUP - Dissertação

Ficheiros deste registo:
Ficheiro Descrição TamanhoFormato 
786489.pdfPADME: Probabilistic Data Management for Efficient ML/AI2.56 MBAdobe PDFThumbnail
Ver/Abrir


Todos os registos no repositório estão protegidos por leis de copyright, com todos os direitos reservados.