HarnessBank é um método para evoluir harnesses de agentes — componentes como prompts, ferramentas e loops de controle que cercam o modelo. A proposta é melhorar o agente alterando esse conjunto, em vez de tratar o modelo como o único elemento a otimizar.
O método descrito usa busca semântica em um banco de genes para encontrar candidatos. A verificação por etapas procura lidar com dois desafios apontados: a seleção gulosa de candidatos e o ruído no feedback gerado pelo próprio sistema.
Para estudar a abordagem, registre primeiro a tarefa e o comportamento esperado do agente. Separe as mudanças no harness por categoria, como prompt, ferramenta ou lógica de controle, para que seja possível comparar o que foi alterado.
Teste candidatos em etapas e mantenha critérios de avaliação definidos antes de observar os resultados. Não trate feedback autogerado como prova de qualidade: compare-o com verificações independentes e acompanhe se uma mudança melhora a tarefa sem prejudicar outras.
Se usar IA para analisar ou aplicar o material, compartilhe apenas dados autorizados e remova informações pessoais ou confidenciais. Preserve exemplos sintéticos ou anonimizados e revise as respostas antes de incorporá-las ao sistema.