Self-Harness: agentes refinam seus próprios harnesses
Paper examina agentes que analisam falhas e propõem mudanças pequenas em seus harnesses, aceitas apenas após testes de regressão. O estudo relata maior sucesso em dados não vistos do Terminal-Bench-2.0.
Publicado em 10 de junho de 2026, o paper Self-Harness explora agentes que analisam as próprias falhas e sugerem pequenas alterações no harness. As mudanças são mantidas quando passam em testes de regressão. A abordagem busca aprimorar prompts, ferramentas, novas tentativas e verificação, sem fine-tuning.
O resumo relata melhora nas taxas de sucesso em dados não vistos do Terminal-Bench-2.0 com MiniMax, Qwen e GLM. Para avaliar o resultado, consulte o paper original e verifique seu método, os testes de regressão e as condições experimentais; o resumo disponível não informa métricas ou detalhes adicionais.