Método descrito mantém o modelo congelado e consulta uma memória textual de tentativas bem e malsucedidas. O relato afirma desempenho comparável ao fine-tuning com 100 exemplos.
Um método chamado Training-Free GRPO mantém o modelo congelado e usa uma memória em linguagem natural com registros de rollouts bem-sucedidos e malsucedidos. Segundo o relato, a abordagem alcança desempenho de fine-tuning com 100 exemplos; esse resultado é uma afirmação do material e não uma garantia para outros cenários.
A proposta pode interessar a engenheiros que buscam reduzir custos computacionais e evitar atualizações de parâmetros durante o treinamento. Para estudar ou aplicar a ideia com IA, evite incluir dados confidenciais da organização e use apenas exemplos autorizados ou anonimizados. O método descrito não é uma funcionalidade da Rota Nacional.