Publicado em 19 de setembro de 2026, o paper estuda feedback de um modelo de linguagem com prompting de LLM-as-a-Judge durante o treinamento, em comparação com modelos de recompensa baseados em preferências humanas e mantidos congelados.
O paper estuda o uso do próprio modelo de linguagem, orientado por prompting de LLM-as-a-Judge, para fornecer feedback durante o treinamento. A abordagem é comparada a modelos de recompensa baseados em preferências humanas que permanecem congelados ao longo do treinamento. O material foi publicado em 19 de setembro de 2026.
A proposta pode interessar a engenheiros que avaliam formas de gerar feedback de treinamento sem depender apenas de modelos de recompensa separados e congelados. Para confirmar escopo e resultados, consulte o paper original e verifique nele os métodos, as comparações e as conclusões; o resumo disponível não informa métricas nem resultados experimentais específicos.