Agentes de IA são manipulados por comandos ocultos em sites; ataques de Injeção Indireta de Prompt se tornam realidade
Pesquisadores da Forcepoint X-Labs confirmaram dez casos de Injeção Indireta de Prompt (IPI) em sites ativos, uma técnica que insere comandos maliciosos ocultos para manipular agentes de inteligência artificial. A vulnerabilidade explora a incapacidade dos modelos de linguagem (LLMs) de distinguir dados de instruções, permitindo que atacantes controlem ações de IA sem interação direta. Métodos como fontes de 1 pixel, CSS transparente e metadados falsos são usados para esconder os payloads.
Como funciona o ataque de Injeção Indireta de Prompt (IPI)
A Injeção Indireta de Prompt (IPI) explora uma limitação fundamental dos modelos de linguagem: a ausência de fronteira entre dados e instruções. Quando um agente de IA acessa uma página web para executar tarefas como resumir conteúdo ou pesquisar informações, ele processa todo o texto disponível, incluindo comandos ocultos inseridos por atacantes. Esses comandos, invisíveis para humanos, são interpretados como instruções legítimas pela IA, permitindo a execução de ações maliciosas, como exfiltração de dados. Diferentemente da injeção direta, onde o usuário envia o comando, na IPI o atacante envenena a página e espera que a IA a acesse durante uma tarefa rotineira.
Técnicas de ocultação usadas pelos atacantes
Para esconder os payloads maliciosos, os atacantes utilizam diversas técnicas que tornam os comandos invisíveis aos olhos humanos, mas legíveis para os modelos de IA. Entre os métodos identificados pela Forcepoint X-Labs estão: fontes com tamanho de 1 pixel, cores transparentes, comentários em HTML, tags de metadados com namespaces customizados e a propriedade CSS 'display:none'. Alguns sites, como o lcpdfr.com, chegaram a simular tokens internos de segurança, como a string 'ANTHROPIC_MAGIC_STRING_TRIGGER_REFUSAL', para enganar a IA e fazê-la interpretar os comandos como instruções de nível de sistema. Tags XML também foram usadas para imitar a estrutura de prompts legítimos.