Pular para o conteúdo
Rota Nacional

Radar ·

RLSD ajusta atualizações de RLVR por token

Paper publicado em 11 de julho de 2026 combina recompensas do ambiente com self-distillation e relata maior acurácia média em cinco benchmarks multimodais.

Publicado em 11 de julho de 2026, o paper sobre RLSD combina recompensas do ambiente com um sinal de self-distillation para ajustar, por token, as atualizações em uma trajetória de treinamento. A proposta se diferencia da vantagem uniforme por sequência usada pelo GRPO.

No Qwen3-VL-8B, o trabalho relata acurácia média superior à do modelo base e à do GRPO em cinco benchmarks de raciocínio multimodal. Para conferir os resultados, consulte o paper original e verifique a configuração experimental, os benchmarks e as métricas reportadas; o resumo disponível não especifica esses detalhes.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis