Pular para o conteúdo
Rota Nacional

Radar ·

ORPO reúne SFT e otimização de preferências

Publicado em 19 de setembro de 2026, o paper apresenta o ORPO, método que combina alinhamento de preferências e supervised fine-tuning sem um modelo de referência.

O paper apresenta o ORPO, uma abordagem sem modelo de referência que combina alinhamento de preferências com supervised fine-tuning (SFT). Durante o SFT alinhado a preferências, o método aplica uma penalidade a gerações desfavorecidas. A proposta é avaliar uma alternativa a executar separadamente as etapas de SFT e alinhamento de preferências.

A descrição do arquivo não informa métricas nem resultados experimentais. Para verificar a contribuição, consulte o paper original pelo título “ORPO combina otimização de preferências com supervised fine-tuning” e examine seus métodos, comparações e resultados; não tome a descrição como evidência de desempenho superior.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis