Publicado em 23 de outubro de 2025, o trabalho apresenta BAPO, método com balanced policy optimization e adaptive clipping para cenários de treinamento off-policy, como partial rollout e reutilização de experiências.
Publicado em 23 de outubro de 2025, o trabalho apresenta BAPO, um método para estabilizar reinforcement learning off-policy em modelos de linguagem. A proposta combina balanced policy optimization com adaptive clipping e aborda cenários como partial rollout e reutilização de experiências. O material não informa métricas ou resultados quantitativos.
Engenheiros que pesquisam treinamento off-policy podem consultar o trabalho e seu código para avaliar o método nesses cenários; verifique no material original os detalhes da implementação e os resultados dos testes. Se usar IA para estudar ou aplicar a proposta, evite inserir dados organizacionais identificáveis e confira as políticas de privacidade e retenção da ferramenta usada. BAPO é uma proposta de pesquisa, não uma capacidade da Rota Nacional.