RULER transforma comparações de agentes em recompensas para GRPO
No OpenPipe ART, engenheiros descrevem critérios em linguagem simples; um modelo ranqueia trajetórias de agentes, e as comparações viram recompensas para treinamento GRPO. O relato cita um agente de 1,4 bilhão de parâmetros jogando 2048.
O RULER, descrito no OpenPipe ART, propõe avaliar agentes que executam tarefas em várias etapas sem exigir que engenheiros codifiquem manualmente cada regra de pontuação.
A equipe define os critérios de avaliação em inglês simples. Um modelo de linguagem compara e ranqueia trajetórias do agente; o ART converte essas comparações em recompensas usadas no treinamento GRPO.
O autor relata aplicar o método a um agente Qwen3 de 1,4 bilhão de parâmetros que jogava 2048. A publicação apresenta essa experiência como um exemplo, não como prova de que o método funciona igualmente bem em qualquer tarefa.
Para estudar ou adaptar a abordagem com IA, evite enviar trajetórias que contenham dados pessoais ou informações internas sem necessidade. Se usar a Rota Nacional, a política organizacional pode aplicar marcadores, remoção ou bloqueio antes da execução do modelo.