Rejection sampling no alinhamento on-policy de LLMs
Publicado em 7 de julho de 2026, o resumo apresenta uma proposta para converter tokens off-policy em tokens tratados como on-policy por rejection sampling e reduzir problemas de variância no alinhamento de LLMs.
Um trabalho publicado em 7 de julho de 2026 propõe usar rejection sampling para converter tokens off-policy em tokens tratados como on-policy no alinhamento de modelos de linguagem. A motivação é lidar com a variância associada às razões de importance sampling acumuladas por token. O resumo aponta que a abordagem pode ajudar engenheiros a compreender a variância e a diferença entre os dados e a política no RL post-training.
Para avaliar a proposta, consulte o paper original e confira como ele define tokens aceitos, quais hipóteses adota e como mede a variância. O resumo disponível não informa resultados quantitativos nem detalhes experimentais; não é possível inferi-los. Se usar IA para estudar o material, evite inserir dados internos ou pessoais sem autorização e confira as conclusões no texto original.