Pular para o conteúdo
Rota Nacional

Radar ·

Rejection sampling no alinhamento on-policy de LLMs

Publicado em 7 de julho de 2026, o resumo apresenta uma proposta para converter tokens off-policy em tokens tratados como on-policy por rejection sampling e reduzir problemas de variância no alinhamento de LLMs.

Um trabalho publicado em 7 de julho de 2026 propõe usar rejection sampling para converter tokens off-policy em tokens tratados como on-policy no alinhamento de modelos de linguagem. A motivação é lidar com a variância associada às razões de importance sampling acumuladas por token. O resumo aponta que a abordagem pode ajudar engenheiros a compreender a variância e a diferença entre os dados e a política no RL post-training.

Para avaliar a proposta, consulte o paper original e confira como ele define tokens aceitos, quais hipóteses adota e como mede a variância. O resumo disponível não informa resultados quantitativos nem detalhes experimentais; não é possível inferi-los. Se usar IA para estudar o material, evite inserir dados internos ou pessoais sem autorização e confira as conclusões no texto original.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis