Utilize este identificador para referenciar este registo: https://hdl.handle.net/10216/169690
Registo completo
Campo DCValorIdioma
dc.creatorGustavo Gomes Moura Almeida da Costa
dc.date.accessioned2026-01-26T05:37:37Z-
dc.date.available2026-01-26T05:37:37Z-
dc.date.issued2025-09-18
dc.date.submitted2025-09-29
dc.identifier.othersigarra:743655
dc.identifier.urihttps://hdl.handle.net/10216/169690-
dc.descriptionEsta dissertação investiga a adaptação de modelos de linguagem de grande escala para geração de código em contextos proprietários, com um estudo de caso realizado em colaboração com a Critical Manufacturing. O trabalho aborda as limitações dos modelos de linguagem de grande escala genéricos quando aplicados a bases de código privadas, incluindo a falta de alinhamento com interfaces de programação de aplicações proprietárias, convenções de programação e requisitos de conformidade. São analisadas estratégias para melhorar o alinhamento ao domínio sem recorrer a fine-tuning completo, incluindo retrieval-augmented generation, integração de contexto estático e mecanismos iterativos de autocorreção. É proposta e implementada uma pipeline iterativa de geração de código que integra progressivamente retrieval-augmented generation, contexto estático, refinamento da system prompt e refinamento do output com base em feedback de compilação. Foi desenvolvida uma benchmark reproduzível de vinte problemas para avaliar estas estratégias, combinando métricas de validade sintática, correção funcional e esforço de desenvolvimento. O esforço de desenvolvimento foi quantificado através do Manual Coding Ratio, definido como a proporção da solução final que tem de ser escrita manualmente após a geração. A avaliação mostrou que o sucesso de compilação aumentou de 25% na primeira tentativa para 45% após três tentativas, enquanto o sucesso de execução passou de 5% para 15%. O esforço de correção, medido pelo Manual Coding Ratio, diminuiu de 45.78% para 41%. Embora o sucesso absoluto de execução se tenha mantido limitado, estes resultados confirmam que retrieval-augmented generation e o refinamento iterativo melhoram a usabilidade prática dos outputs dos modelos de linguagem de grande escala em ambientes proprietários. O estudo contribui com uma metodologia estruturada para avaliar a geração de código assistida por modelos de linguagem de grande escala em contextos industriais e fornece evidência sobre os compromissos entre eficiência de custos, desempenho e conformidade na utilização de modelos de linguagem de grande escala sob restrições de recursos e de privacidade.
dc.description.abstractThis dissertation investigates the adaptation of large language models for proprietary code generation within industrial contexts, with a case study conducted in collaboration with Critical Manufacturing. The work addresses the limitations of generic large language models when applied to private codebases, including the lack of alignment with proprietary application programming interfaces, coding conventions, and compliance requirements. It examines strategies for improving domain alignment without full-scale fine-tuning, including retrieval-augmented generation, static context integration, and iterative self-correction mechanisms. It proposes and implements an iterative pipeline for code generation that progressively integrates retrieval-augmented generation, static context, system prompt refinement, and compilation-based feedback output refinement. A reproducible benchmark of twenty problems was developed to evaluate these strategies, combining metrics of syntactic validity, functional correctness, and developer effort. Developer effort was quantified through the Manual Coding Ratio, defined as the proportion of the final solution that must be manually authored after generation. The evaluation showed that compilation success increased from 25\% at the first attempt to 45\% after three attempts, while execution success rose from 5\% to 15\%. Corrective effort, measured by the Manual Coding Ratio, decreased from 45.78\% to 41\%. Although absolute execution success remained limited, these results confirm that retrieval and iterative refinement improve the practical usability of large language model outputs in proprietary environments. The study contributes a structured methodology for assessing large language model-assisted code generation in industrial contexts and provides evidence of the trade-offs between cost-efficiency, performance, and compliance when deploying large language models under resource and privacy constraints.
dc.language.isoeng
dc.rightsembargoedAccess
dc.subjectEngenharia electrotécnica, electrónica e informática
dc.subjectElectrical engineering, Electronic engineering, Information engineering
dc.titleAdapting Large Language Models for Code Generation in Proprietary Contexts: An Industrial Case Study
dc.typeDissertação
dc.date.embargo2028-09-17
dc.contributor.uportoFaculdade de Engenharia
dc.identifier.tid204113954
dc.subject.fosCiências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática
dc.subject.fosEngineering and technology::Electrical engineering, Electronic engineering, Information engineering
thesis.degree.disciplineMestrado em Engenharia Informática e Computação
thesis.degree.grantorFaculdade de Engenharia
thesis.degree.grantorUniversidade do Porto
thesis.degree.level1
rcaap.embargofctEsta dissertação não pode ser publicada publicamente a pedido da empresa parceira, Critical Manufacturing, por conter informação sensível sobre ferramentas internas e APIs proprietárias.
Aparece nas coleções:FEUP - Dissertação

Ficheiros deste registo:
Ficheiro Descrição TamanhoFormato 
743655.pdf
  Restricted Access
Adapting Large Language Models for Code Generation in Proprietary Contexts: An Industrial Case Study4.53 MBAdobe PDFVer/Abrir


Todos os registos no repositório estão protegidos por leis de copyright, com todos os direitos reservados.