RULER transforma avaliações de agentes em recompensas GRPO
Publicado em 17 de setembro de 2026, o relato descreve o RULER no OpenPipe ART: um LLM ranqueia trajetórias segundo critérios em inglês simples, e as comparações são convertidas em recompensas para treinamento GRPO.
Em publicação de 17 de setembro de 2026, o autor apresenta o RULER no OpenPipe ART. Engenheiros definem critérios de avaliação em inglês simples; um LLM ranqueia trajetórias de agentes e o ART converte as comparações em recompensas usadas no treinamento GRPO. A proposta é avaliar comportamentos em várias etapas sem escrever manualmente um conjunto de regras de pontuação. O relato cita o uso do método com um agente Qwen3 1.4B jogando 2048.
Para conferir o resultado, consulte a publicação original do projeto e verifique como os critérios e as trajetórias foram definidos, além de como as comparações viraram recompensas. O texto disponível não apresenta métricas comparativas nem resultados quantitativos, portanto não permite concluir, por si só, que o método supera outras abordagens.