Please use this identifier to cite or link to this item:
https://ric.cps.sp.gov.br/handle/123456789/46635| Title: | Prompt injection em modelos de linguagem: uma análise de segurança |
| Other Titles: | Prompt injection in language models: a security analysis |
| Authors: | SANTOS, Pedro Afonso Ferrari CINTRA, Vitor Rosa |
| Advisor: | BERGAMASCO, Daives Arakem |
| Other contributor: | SOUZA, Alexandre Donizetti de GIRALDI, Marcus Vinícius Lahr |
| type of document: | Monografia |
| Keywords: | Informação - segurança;Linguagem de programação;Inteligência artificial |
| Issue Date: | 8-Jun-2026 |
| Publisher: | 004 |
| Citation: | SANTOS, Pedro Afonso Ferrari; CINTRA, Vitor Rosa. Prompt injection em modelos de linguagem: uma análise de segurança , 2026. Trabalho de conclusão de curso (Curso Superior de Tecnologia em Segurança da Informação) - Faculdade de Tecnologia de Americana "Ministro Ralph Biasi", Americana, 2026. |
| Abstract: | O avanço dos Modelos de Linguagem de Grande Escala (LLMs) tem ampliado
significativamente sua aplicação em sistemas computacionais modernos, especialmente em
soluções baseadas em inteligência artificial generativa, ao mesmo tempo em que introduz novos
desafios no campo da segurança da informação, com destaque para vulnerabilidades
relacionadas à manipulação de entradas textuais. Nesse contexto, este trabalho tem como
objetivo analisar a suscetibilidade de diferentes modelos de linguagem a ataques do tipo Prompt
Injection, técnica que busca alterar o comportamento do sistema por meio de instruções
adversariais em linguagem natural. A pesquisa possui caráter exploratório, com abordagem
qualitativa e apoio de análise comparativa, sendo conduzida por meio de experimentos
controlados com três modelos amplamente disponíveis ao público: ChatGPT, Gemini e
DeepSeek, selecionados por sua relevância e ampla utilização. Os modelos foram avaliados em
três cenários distintos: ataques diretos por meio de prompts, simulação de aplicação baseada
em LLM e integração com conteúdo externo em contexto semelhante ao Retrieval-Augmented
Generation (RAG). As interações foram registradas e analisadas com base em critérios de
suscetibilidade ou resistência aos ataques. Os resultados indicam que a eficácia das técnicas de
Prompt Injection varia conforme o modelo e o contexto de aplicação, evidenciando que nenhum
dos modelos apresentou resistência total em todos os cenários e que há vulnerabilidades tanto
em interações diretas quanto em ambientes mais complexos. Observou-se maior suscetibilidade
em cenários que envolvem integração com conteúdo externos, o que sugere uma ampliação da
superfície de ataque. Conclui-se que, apesar dos avanços em desempenho e alinhamento, os
modelos de linguagem ainda apresentam limitações relevantes no que se refere à segurança,
reforçando a necessidade de adoção de estratégias de mitigação em múltiplas camadas para
aumentar a confiabilidade de aplicações baseadas em LLMs em ambientes reais.
Palavras-chave: segurança da informação; modelos de linguagem; prompt injection. The advancement of Large Language Models (LLMs) has significantly expanded their application in modern computational systems, especially in solutions based on generative artificial intelligence, while also introducing new challenges in the field of information security, particularly regarding vulnerabilities related to the manipulation of textual inputs. In this context, this study aims to analyze the susceptibility of different language models to Prompt Injection attacks, a technique that seeks to alter system behavior through adversarial instructions written in natural language. This research has an exploratory nature, with a qualitative approach supported by comparative analysis, and is based on controlled experiments conducted using three models widely available to the public—ChatGPT, Gemini, and DeepSeek—selected due to their relevance and widespread use. These models were evaluated in three distinct scenarios: direct prompt-based attacks, simulation of LLM-based applications, and integration with external content in a context similar to Retrieval-Augmented Generation (RAG). The interactions were recorded and analyzed based on criteria of susceptibility or resistance to the attacks. The results indicate that the effectiveness of Prompt Injection techniques varies according to the model and the application context, showing that none of the models demonstrated complete resistance in all scenarios and that vulnerabilities exist in both direct interactions and more complex environments. A higher level of susceptibility was observed in scenarios involving integration with external content, suggesting an expansion of the attack surface. It is concluded that, although language models have achieved relevant advances in terms of performance and alignment, important limitations regarding security still remain, reinforcing the need to adopt multi-layered mitigation strategies in order to increase the reliability of LLM-based applications in real-world environments. Keywords: information security; language models; prompt injection. |
| URI: | https://ric.cps.sp.gov.br/handle/123456789/46635 |
| Appears in Collections: | Trabalhos de Conclusão de Curso |
Files in This Item:
| File | Description | Size | Format | |
|---|---|---|---|---|
| 20261S_Pedro Afonso Ferrari Santos_OD2968.pdf Restricted Access | 5.34 MB | Adobe PDF | View/Open Request a copy | |
| Termos de Autorização - Pedro; Vitor.pdf Restricted Access | 2.04 MB | Adobe PDF | View/Open Request a copy |
Items in DSpace are protected by copyright, with all rights reserved, unless otherwise indicated.