Please use this identifier to cite or link to this item:
https://hdl.handle.net/10216/175572| Author(s): | Diogo Filipe Pereira Santos |
| Title: | PADME: Probabilistic Data Management for Efficient ML/AI |
| Issue Date: | 2026-07-16 |
| Abstract: | Distributed storage systems replicate large volumes of data, but do so without considering whether all replicated items are equally useful. At the same time, the Machine Learning (ML) literature has shown that comparable model performance can often be achieved with less data. This disser- tation fits into this context, aiming to explore how utility-aware retention can be embedded into decentralised storage systems, with the goal of reducing storage and communication costs while preserving the quality of ML models trained on the retained data. The work developed centred on the design of PADME, a utility-aware architecture for decen- tralised key-value stores that integrates probabilistic data retention directly into storage and repli- cation protocols. A theoretical grounding is established by surveying relevant distributed systems concepts and analysing a group of subset selection techniques and their suitability for integration into an online distributed setting. A prototype was subsequently developed and evaluated on four tabular datasets covering bi- nary classification, multi-class classification, and regression. Results show that substantial reduc- tions in retained data and replication payload can be achieved without a proportional loss in model performance. In binary classification tasks, utility-aware retention maintained competitive perfor- mance at retention ratios as low as 1%, while reducing replication payload by over 90%. These findings suggest that integrating data reduction into storage protocols is a promising direction towards more efficient and sustainable distributed data management. |
| Description: | Os sistemas de armazenamento distribuído replicam grandes volumes de dados, mas fazem-no sem considerar se todos os itens replicados são igualmente úteis. Ao mesmo tempo, a literatura de ML tem demonstrado que é frequentemente possível alcançar um desempenho comparável no treino de modelos usando menos dados. Esta dissertação insere-se neste contexto, com o objetivo de explorar como a retenção baseada na utilidade estimada dos dados pode ser integrada em sistemas de armazenamento descentralizados, visando reduzir os custos de armazenamento e comunicação, preservando, simultaneamente, a qualidade dos modelos de ML treinados com os dados retidos. O trabalho desenvolvido centrou-se no design de PADME, uma arquitetura orientada à utili- dade para sistemas key-value descentralizados, que integra a retenção probabilística de dados dire- tamente nos protocolos de armazenamento e replicação. Estabelece-se uma base teórica através da revisão de conceitos relevantes de sistemas distribuídos e da análise de um conjunto de técnicas de seleção de subconjuntos, bem como da sua adequação para integração num ambiente distribuído online. Posteriormente, foi desenvolvido um protótipo, o qual foi avaliado em quatro conjuntos de da- dos tabulares que abrangem tarefas de classificação binária, classificação multiclasse e regressão. Os resultados mostram que é possível alcançar reduções substanciais nos dados retidos e no vol- ume de tráfego de replicação sem uma perda proporcional no desempenho dos modelos. Nas tare- fas de classificação binária, a retenção guiada pela utilidade manteve um desempenho competitivo com taxas de retenção tão baixas quanto 1%, reduzindo simultaneamente a carga de replicação em mais de 90%. Estas conclusões sugerem que a integração da redução de dados nos protocolos de armazenamento é uma via promissora para uma gestão de dados distribuída mais eficiente e sustentável. |
| Subject: | Engenharia electrotécnica, electrónica e informática Electrical engineering, Electronic engineering, Information engineering |
| Scientific areas: | Ciências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática Engineering and technology::Electrical engineering, Electronic engineering, Information engineering |
| URI: | https://hdl.handle.net/10216/175572 |
| Document Type: | Dissertação |
| Rights: | openAccess |
| Appears in Collections: | FEUP - Dissertação |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| 786489.pdf | PADME: Probabilistic Data Management for Efficient ML/AI | 2.56 MB | Adobe PDF | ![]() View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.
