Publicado em 19 de setembro de 2026, o paper apresenta o ORPO, método que combina alinhamento de preferências e supervised fine-tuning sem um modelo de referência.
O paper apresenta o ORPO, uma abordagem sem modelo de referência que combina alinhamento de preferências com supervised fine-tuning (SFT). Durante o SFT alinhado a preferências, o método aplica uma penalidade a gerações desfavorecidas. A proposta é avaliar uma alternativa a executar separadamente as etapas de SFT e alinhamento de preferências.
A descrição do arquivo não informa métricas nem resultados experimentais. Para verificar a contribuição, consulte o paper original pelo título “ORPO combina otimização de preferências com supervised fine-tuning” e examine seus métodos, comparações e resultados; não tome a descrição como evidência de desempenho superior.