Please use this identifier to cite or link to this item:
https://hdl.handle.net/10216/169690| Author(s): | Gustavo Gomes Moura Almeida da Costa |
| Title: | Adapting Large Language Models for Code Generation in Proprietary Contexts: An Industrial Case Study |
| Issue Date: | 2025-09-18 |
| Abstract: | This dissertation investigates the adaptation of large language models for proprietary code generation within industrial contexts, with a case study conducted in collaboration with Critical Manufacturing. The work addresses the limitations of generic large language models when applied to private codebases, including the lack of alignment with proprietary application programming interfaces, coding conventions, and compliance requirements. It examines strategies for improving domain alignment without full-scale fine-tuning, including retrieval-augmented generation, static context integration, and iterative self-correction mechanisms. It proposes and implements an iterative pipeline for code generation that progressively integrates retrieval-augmented generation, static context, system prompt refinement, and compilation-based feedback output refinement. A reproducible benchmark of twenty problems was developed to evaluate these strategies, combining metrics of syntactic validity, functional correctness, and developer effort. Developer effort was quantified through the Manual Coding Ratio, defined as the proportion of the final solution that must be manually authored after generation. The evaluation showed that compilation success increased from 25\% at the first attempt to 45\% after three attempts, while execution success rose from 5\% to 15\%. Corrective effort, measured by the Manual Coding Ratio, decreased from 45.78\% to 41\%. Although absolute execution success remained limited, these results confirm that retrieval and iterative refinement improve the practical usability of large language model outputs in proprietary environments. The study contributes a structured methodology for assessing large language model-assisted code generation in industrial contexts and provides evidence of the trade-offs between cost-efficiency, performance, and compliance when deploying large language models under resource and privacy constraints. |
| Description: | Esta dissertação investiga a adaptação de modelos de linguagem de grande escala para geração de código em contextos proprietários, com um estudo de caso realizado em colaboração com a Critical Manufacturing. O trabalho aborda as limitações dos modelos de linguagem de grande escala genéricos quando aplicados a bases de código privadas, incluindo a falta de alinhamento com interfaces de programação de aplicações proprietárias, convenções de programação e requisitos de conformidade. São analisadas estratégias para melhorar o alinhamento ao domínio sem recorrer a fine-tuning completo, incluindo retrieval-augmented generation, integração de contexto estático e mecanismos iterativos de autocorreção. É proposta e implementada uma pipeline iterativa de geração de código que integra progressivamente retrieval-augmented generation, contexto estático, refinamento da system prompt e refinamento do output com base em feedback de compilação. Foi desenvolvida uma benchmark reproduzível de vinte problemas para avaliar estas estratégias, combinando métricas de validade sintática, correção funcional e esforço de desenvolvimento. O esforço de desenvolvimento foi quantificado através do Manual Coding Ratio, definido como a proporção da solução final que tem de ser escrita manualmente após a geração. A avaliação mostrou que o sucesso de compilação aumentou de 25% na primeira tentativa para 45% após três tentativas, enquanto o sucesso de execução passou de 5% para 15%. O esforço de correção, medido pelo Manual Coding Ratio, diminuiu de 45.78% para 41%. Embora o sucesso absoluto de execução se tenha mantido limitado, estes resultados confirmam que retrieval-augmented generation e o refinamento iterativo melhoram a usabilidade prática dos outputs dos modelos de linguagem de grande escala em ambientes proprietários. O estudo contribui com uma metodologia estruturada para avaliar a geração de código assistida por modelos de linguagem de grande escala em contextos industriais e fornece evidência sobre os compromissos entre eficiência de custos, desempenho e conformidade na utilização de modelos de linguagem de grande escala sob restrições de recursos e de privacidade. |
| Subject: | Engenharia electrotécnica, electrónica e informática Electrical engineering, Electronic engineering, Information engineering |
| Scientific areas: | Ciências da engenharia e tecnologias::Engenharia electrotécnica, electrónica e informática Engineering and technology::Electrical engineering, Electronic engineering, Information engineering |
| TID identifier: | 204113954 |
| URI: | https://hdl.handle.net/10216/169690 |
| Document Type: | Dissertação |
| Rights: | embargoedAccess |
| Embargo End Date: | 2028-09-17 |
| Appears in Collections: | FEUP - Dissertação |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| 743655.pdf Restricted Access | Adapting Large Language Models for Code Generation in Proprietary Contexts: An Industrial Case Study | 4.53 MB | Adobe PDF | View/Open |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.