Paper publicado em 11 de julho de 2026 combina recompensas do ambiente com self-distillation e relata maior acurácia média em cinco benchmarks multimodais.
Publicado em 11 de julho de 2026, o paper sobre RLSD combina recompensas do ambiente com um sinal de self-distillation para ajustar, por token, as atualizações em uma trajetória de treinamento. A proposta se diferencia da vantagem uniforme por sequência usada pelo GRPO.
No Qwen3-VL-8B, o trabalho relata acurácia média superior à do modelo base e à do GRPO em cinco benchmarks de raciocínio multimodal. Para conferir os resultados, consulte o paper original e verifique a configuração experimental, os benchmarks e as métricas reportadas; o resumo disponível não especifica esses detalhes.