ExploitGym avalia agentes de IA em exploração de vulnerabilidades
Pesquisa apresentada em 10 de agosto de 2026 descreve uma avaliação da capacidade de agentes de IA de converter vulnerabilidades em impactos concretos, como acesso não autorizado a arquivos ou execução de código.
O ExploitGym estuda se agentes de IA conseguem transformar vulnerabilidades em impactos concretos, incluindo acesso não autorizado a arquivos e execução de código. A tarefa exige raciocínio de baixo nível sobre programas, adaptação durante a execução e progresso sustentado. A pesquisa propõe uma forma de avaliar essa capacidade; o material fornecido não informa resultados quantitativos nem o desempenho de agentes específicos.
Para entender o alcance do trabalho, consulte a publicação original e confira sua metodologia, os cenários avaliados e os resultados apresentados. Se usar uma IA para estudar ou aplicar o material, evite inserir código, dados ou detalhes internos da organização sem autorização e proteja informações sensíveis conforme as políticas internas.