HijackRAG expõe riscos de textos injetados em sistemas RAG
O HijackRAG combina textos recuperados, desvio de atenção e instruções para manipular respostas de sistemas RAG, destacando riscos em bases de conhecimento e limites das defesas existentes.
O HijackRAG descreve um ataque que combina textos recuperados, desvio de atenção e instruções para manipular as respostas de sistemas RAG. O trabalho apresenta abordagens black-box e white-box, com otimização baseada em gradientes.
A lição prática é tratar documentos recuperados como conteúdo não confiável, não como instruções válidas. Separe as instruções do sistema dos trechos consultados e teste se entradas maliciosas conseguem alterar a resposta ou contornar as regras.
Ao estudar ou aplicar esses resultados com IA, evite enviar bases internas, dados pessoais ou documentos confidenciais sem autorização. Use exemplos sintéticos ou trechos públicos e limite o acesso ao material de teste.
Não há uma defesa universal descrita no briefing. Avalie as proteções no seu próprio fluxo RAG, registre os casos de falha e revise as regras e fontes de recuperação antes de ampliar o uso.