Publicado em 7 de novembro de 2025, o relato descreve uma estratégia iterativa de treinamento para RLVR e ganhos reportados em uma avaliação matemática.
Publicado em 7 de novembro de 2025, o relato apresenta o RLoop, que alterna exploração por aprendizado por reforço (RL) com consolidação por RFT a partir de trajetórias de especialistas filtradas. A proposta é uma forma de inicializar políticas em pipelines de RLVR, com o objetivo de reduzir overfitting e esquecimento.
No experimento descrito, em Qwen-2.5-7B-Math com DAPO-17K, o post relata cerca de 9% a mais em Avg@32 e mais de 15% em Pass@32 em comparação com RL. Esses números são resultados reportados pela fonte, não uma garantia de desempenho geral. Para avaliar a alegação, consulte o post original e confira a configuração, as métricas e as condições de comparação; o resumo disponível não detalha esses elementos.