Pular para o conteúdo
Rota Nacional

Guias ·

RULER transforma comparações de agentes em recompensas para GRPO

No OpenPipe ART, engenheiros descrevem critérios em linguagem simples; um modelo ranqueia trajetórias de agentes, e as comparações viram recompensas para treinamento GRPO. O relato cita um agente de 1,4 bilhão de parâmetros jogando 2048.

O RULER, descrito no OpenPipe ART, propõe avaliar agentes que executam tarefas em várias etapas sem exigir que engenheiros codifiquem manualmente cada regra de pontuação.

A equipe define os critérios de avaliação em inglês simples. Um modelo de linguagem compara e ranqueia trajetórias do agente; o ART converte essas comparações em recompensas usadas no treinamento GRPO.

O autor relata aplicar o método a um agente Qwen3 de 1,4 bilhão de parâmetros que jogava 2048. A publicação apresenta essa experiência como um exemplo, não como prova de que o método funciona igualmente bem em qualquer tarefa.

Para estudar ou adaptar a abordagem com IA, evite enviar trajetórias que contenham dados pessoais ou informações internas sem necessidade. Se usar a Rota Nacional, a política organizacional pode aplicar marcadores, remoção ou bloqueio antes da execução do modelo.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis