Publicação de 21 de setembro de 2026 descreve o Trust Region DPO (TR-DPO), que incorpora uma penalidade de divergência KL à loss do DPO para limitar o desvio em relação ao modelo de referência.
Em 21 de setembro de 2026, uma publicação apresentou o Trust Region DPO (TR-DPO). A abordagem acrescenta diretamente à loss do DPO uma penalidade de divergência KL, com o objetivo de limitar o desvio em relação ao modelo de referência. Segundo o autor, isso estabiliza o treinamento de RL offline.
O método pode interessar a engenheiros que avaliam estabilidade e distribution shift no treinamento com DPO. Consulte a publicação original para verificar a formulação e os resultados apresentados; o resumo disponível não detalha experimentos nem métricas.