Pular para o conteúdo
Rota Nacional

Radar ·

RLoop alterna RL e consolidação de políticas

Publicado em 7 de novembro de 2025, o relato descreve uma estratégia iterativa de treinamento para RLVR e ganhos reportados em uma avaliação matemática.

Publicado em 7 de novembro de 2025, o relato apresenta o RLoop, que alterna exploração por aprendizado por reforço (RL) com consolidação por RFT a partir de trajetórias de especialistas filtradas. A proposta é uma forma de inicializar políticas em pipelines de RLVR, com o objetivo de reduzir overfitting e esquecimento.

No experimento descrito, em Qwen-2.5-7B-Math com DAPO-17K, o post relata cerca de 9% a mais em Avg@32 e mais de 15% em Pass@32 em comparação com RL. Esses números são resultados reportados pela fonte, não uma garantia de desempenho geral. Para avaliar a alegação, consulte o post original e confira a configuração, as métricas e as condições de comparação; o resumo disponível não detalha esses elementos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis