Pular para o conteúdo
Rota Nacional

Radar ·

LaSeR explora recompensas de último token em LLMs

Em publicação de 19 de outubro de 2025, a Tencent apresenta o LaSeR, algoritmo de reinforcement learning que alinha scores do último token a recompensas reais para raciocínio e self-rewarding de modelos de linguagem. O post menciona uma inferência de token extra.

Publicado em 19 de outubro de 2025, o post da Tencent apresenta o LaSeR, um algoritmo de reinforcement learning para modelos de linguagem. A proposta alinha scores do último token a recompensas reais, com aplicações descritas para raciocínio e self-rewarding de LLMs; segundo a publicação, o método usa uma inferência de token extra.

O post aponta possível interesse para engenheiros que investigam otimização de rewards de menor custo, sem quantificar economia ou apresentar resultados comparativos no material fornecido. Consulte a publicação original para avaliar método e evidências. Se usar IA para estudar ou aplicar a abordagem, não envie dados organizacionais sensíveis sem necessidade e siga a política de privacidade da sua organização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis