Avaliação da Mutação de Malware por LLMs e sua Evasão em Sistemas de Detecção
Este trabalho investiga o impacto da utilização de Large Language Models (LLMs) especializadas na geração de variantes de malware e sua capacidade de evadir sistemas de detecção. Foram selecionadas amostras representativas em diversas linguagens (HTML/JS, VBScript, Python e C) e aplicadas técnicas de mutação por meio das LLMs DeepSeek e HackerGPT, além de comparações com técnicas tradicionais de ofuscação e ferramentas externas (VBSCrambler, JS-Obfuscator e Tigress). O estudo empregou prompts (P1–P5), aumentando progressivamente a complexidade das mutações, e avaliou os resultados utilizando VirusTotal e LLMs classificadoras (ChatGPT e Gemini). Foi analisada a métrica Taxa de Detecção, permitindo comparar a eficácia das LLMs com métodos convencionais de ofuscação. Os resultados demonstraram que as variantes geradas por LLMs conseguem reduzir significativamente a detecção, alcançando desempenho equivalente às técnicas tradicionais de ofuscação na maioria das amostras avaliadas e superando em um dos casos analisados (VBS.LoveLetter). As LLMs classificadoras continuaram reconhecendo corretamente a maioria das amostras maliciosas, enquanto programas legítimos permaneceram não detectados. Os resultados evidenciam o potencial das LLMs para gerar malware polimórfico e semanticamente equivalente ao original, ao mesmo tempo em que reforçam os desafios impostos aos sistemas automatizados de detecção.