Como reduzir a diferença entre treino e inferência em RL para LLMs
Um artigo examina como engines separados podem atribuir probabilidades inconsistentes às mesmas trajetórias no post-training de LLMs e descreve TIS e a rejeição de atualizações de checkpoint.
No post-training de modelos de linguagem com aprendizado por reforço (RL), engines diferentes para treino e inferência podem atribuir probabilidades inconsistentes às mesmas trajetórias. Essa diferença pode afetar a correspondência entre os dados usados no treino e os resultados avaliados na inferência.
O artigo descreve TIS e a rejeição de atualizações de checkpoint quando as recompensas de treino e inferência divergem. A rejeição busca lidar com essa discrepância, mas tem um custo: exige rollouts adicionais. Para estudar ou aplicar o material com IA, evite inserir dados internos ou pessoais sem autorização e revise as regras de tratamento de dados da organização.