HERMES: harness em nível de componente com LLMs para tarefas de software
Artigo no arXiv propõe o HERMES, um harness de agentes de código em que cada componente do repositório tem um LLM residente. Os autores relatam ganhos em migração e em quatro benchmarks de engenharia de software frente a harnesses de baseline equivalentes.
Um artigo no arXiv propõe o HERMES, um harness de agentes de código em que cada componente do repositório tem um LLM residente que conhece o seu código. Segundo o resumo publicado, os autores relatam ganhos em tarefas de migração e em quatro benchmarks de engenharia de software, comparados a harnesses de baseline equivalentes. A tese central é que o desenho do harness, e não apenas a escolha do modelo, pode produzir grandes ganhos em agentes de código de longo horizonte. A fonte não informa nomes dos benchmarks, números nem detalhes de implementação, que devem ser consultados no artigo original.
Relevância para quem usa a Rota Nacional: a Rota não oferece o HERMES nem reproduz a arquitetura descrita; o material é uma referência de pesquisa. Quem usar IA para estudar o artigo ou testar ideias semelhantes deve evitar colar código proprietário, credenciais ou dados pessoais em prompts. A Rota detecta CPF, CNPJ, e-mail, telefone e nomes de pessoas antes de qualquer modelo rodar e aplica a política da organização (marcadores, remoção ou bloqueio), mas isso não substitui a revisão de segredos e de código sensível antes do envio. Para verificar as afirmações, leia o artigo original e reproduza apenas os experimentos que você tem autorização para executar.