Em publicação datada de 15 de agosto de 2025, pesquisadores da Tencent propuseram o RLVMR, método que combina recompensas pelo resultado com supervisão de etapas do agente. O texto relata 83,6% em tarefas inéditas mais difíceis de ALFWorld e ScienceWorld para um agente 7B.
Em 15 de agosto de 2025, pesquisadores da Tencent apresentaram o RLVMR, uma proposta de treinamento de agentes que combina recompensas pelo resultado final com supervisão de etapas como planejamento, exploração e reflexão. A ideia é orientar não apenas o que o agente alcança, mas também partes do caminho até o resultado.
Segundo o resumo publicado, um agente 7B teria obtido 83,6% nas tarefas inéditas mais difíceis de ALFWorld e ScienceWorld. O texto sugere que recompensas por etapa podem ajudar a reduzir ações redundantes e a recuperação após erros; não informa, porém, detalhes suficientes para avaliar o protocolo ou comparar o resultado. Consulte a publicação original e confira nela as métricas, condições dos testes e definição das tarefas.