Em publicação de 19 de outubro de 2025, a Tencent apresenta o LaSeR, algoritmo de reinforcement learning que alinha scores do último token a recompensas reais para raciocínio e self-rewarding de modelos de linguagem. O post menciona uma inferência de token extra.
Publicado em 19 de outubro de 2025, o post da Tencent apresenta o LaSeR, um algoritmo de reinforcement learning para modelos de linguagem. A proposta alinha scores do último token a recompensas reais, com aplicações descritas para raciocínio e self-rewarding de LLMs; segundo a publicação, o método usa uma inferência de token extra.
O post aponta possível interesse para engenheiros que investigam otimização de rewards de menor custo, sem quantificar economia ou apresentar resultados comparativos no material fornecido. Consulte a publicação original para avaliar método e evidências. Se usar IA para estudar ou aplicar a abordagem, não envie dados organizacionais sensíveis sem necessidade e siga a política de privacidade da sua organização.