Pular para o conteúdo
Rota Nacional

Radar ·

Como reduzir a diferença entre treino e inferência em RL para LLMs

Um artigo examina como engines separados podem atribuir probabilidades inconsistentes às mesmas trajetórias no post-training de LLMs e descreve TIS e a rejeição de atualizações de checkpoint.

No post-training de modelos de linguagem com aprendizado por reforço (RL), engines diferentes para treino e inferência podem atribuir probabilidades inconsistentes às mesmas trajetórias. Essa diferença pode afetar a correspondência entre os dados usados no treino e os resultados avaliados na inferência.

O artigo descreve TIS e a rejeição de atualizações de checkpoint quando as recompensas de treino e inferência divergem. A rejeição busca lidar com essa discrepância, mas tem um custo: exige rollouts adicionais. Para estudar ou aplicar o material com IA, evite inserir dados internos ou pessoais sem autorização e revise as regras de tratamento de dados da organização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis