Please use this identifier to cite or link to this item: https://hdl.handle.net/10216/175857
Author(s): Diogo Coutinho da Silva
Title: Fine-tuning an LLM to generate clinical notes from audio transcriptions
Issue Date: 2026-07-09
Abstract: Clinical documentation is a critical but time-consuming burden for healthcare professionals, often contributing to burnout and reducing time for patient care. While Large Language Models (LLMs) offer a promising solution to automate the generation of clinical notes from patient-doctor dialogues, their adoption in Europe faces two major hurdles: strict privacy regulations (GDPR) that discourage the use of external cloud-based APIs, and a scarcity of models optimized for European Portuguese (PT-PT). This thesis addresses these challenges by developing and evaluating a privacy-preserving pipeline for automated clinical note generation in PT-PT. We investigate the viability of adapting and self-hosting open-weight LLMs through Parameter-Efficient Fine-Tuning, specifically QLoRA, with the main long-context benchmark covering Qwen3 8B, Llama 3.1 8B, and Gervásio 8B, and a secondary short-context benchmark covering BioMistral 7B, Llama 3.1 8B, and EuroLLM 9B. The study uses an anonymized dataset of real-world telemedicine transcripts to train models to produce structured notes following the specific Knokcare format (analogous to SOAP). A central contribution of this work is to demonstrate the operational viability of generation from anonymized inputs. However, the exact magnitude of the privacy-utility trade-off remained open because the thesis did not include a matched raw-versus-anonymized ablation. Furthermore, we propose a robust evaluation framework that moves beyond traditional metrics, employing a dual-vector "LLM-as-a-judge" approach to detect hallucinations and assess critical omissions, documentation utility, and transcript-grounded factual consistency. The results show that fine-tuning consistently improves structure, documentation utility, and PT-PT clinical style. However, proprietary models retained an advantage in safety and critical-omission control, so the most defensible use case is clinician-in-the-loop drafting assistance with mandatory clinical review rather than autonomous clinical note writing.
Description: A documentação clínica representa uma carga administrativa significativa para os profissionais de saúde, contribuindo frequentemente para o burnout e reduzindo o tempo disponível para os doentes. Embora os Large Language Models (LLMs) ofereçam uma solução promissora para automatizar a geração de notas clínicas a partir de diálogos médico-paciente, a sua adoção na Europa enfrenta dois obstáculos principais: regulamentos de privacidade estritos (GDPR) que limitam o uso de APIs externas na nuvem, e a escassez de modelos otimizados para o Português Europeu (PT-PT). Esta dissertação aborda estes desafios através do desenvolvimento e avaliação de uma pipeline de preservação de privacidade para a geração automática de notas clínicas em PT-PT. Investigamos a viabilidade de adaptar e alojar localmente modelos de pesos abertos (open-weight) através de Parameter-Efficient Fine-Tuning, em particular QLoRA, tendo o benchmark principal de longo contexto incidido sobre o Qwen3 8B, o Llama 3.1 8B e o Gervásio 8B, e o benchmark secundário de curto contexto sobre o BioMistral 7B, o Llama 3.1 8B e o EuroLLM 9B. O estudo utiliza um conjunto anonimizado de transcrições reais de telemedicina para treinar modelos capazes de produzir notas estruturadas no formato específico da Knokcare (análogo ao SOAP). Uma contribuição central deste trabalho foi demonstrar a viabilidade operacional da geração a partir de dados anonimizados. Contudo, a magnitude exata do compromisso entre privacidade e utilidade permaneceu em aberto, uma vez que a tese não incluiu uma ablação pareada entre dados brutos e dados anonimizados. Além disso, propomos uma estrutura de avaliação robusta que ultrapassa as métricas tradicionais, empregando uma abordagem de "LLM-as-a-judge" em dois vetores para detetar alucinações, avaliar omissões críticas e medir a utilidade documental e a consistência factual face à transcrição. Os resultados mostram que o fine-tuning melhora de forma consistente a estrutura, a utilidade documental e o registo clínico em PT-PT. Contudo, os modelos proprietários mantiveram vantagem em segurança e no controlo de omissões críticas, pelo que a utilização mais defensável é a de um assistente de rascunhos (drafting assistant) com revisão clínica obrigatória, e não a de um sistema autónomo de escrita clínica.
Subject: Engenharia electrotécnica, electrónica e informática
Electrical engineering, Electronic engineering, Information engineering
Scientific areas: Ciências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática
Engineering and technology::Electrical engineering, Electronic engineering, Information engineering
URI: https://hdl.handle.net/10216/175857
Document Type: Dissertação
Rights: embargoedAccess
Embargo End Date: 2029-07-08
Appears in Collections:FEUP - Dissertação

Files in This Item:
File Description SizeFormat 
786875.pdf
  Restricted Access
Fine-tuning an LLM to generate clinical notes from audio transcriptions8.73 MBAdobe PDFView/Open


Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.