Pular para o conteúdo
Rota Nacional

Radar ·

RLVMR combina recompensas e supervisão por etapa

Em publicação datada de 15 de agosto de 2025, pesquisadores da Tencent propuseram o RLVMR, método que combina recompensas pelo resultado com supervisão de etapas do agente. O texto relata 83,6% em tarefas inéditas mais difíceis de ALFWorld e ScienceWorld para um agente 7B.

Em 15 de agosto de 2025, pesquisadores da Tencent apresentaram o RLVMR, uma proposta de treinamento de agentes que combina recompensas pelo resultado final com supervisão de etapas como planejamento, exploração e reflexão. A ideia é orientar não apenas o que o agente alcança, mas também partes do caminho até o resultado.

Segundo o resumo publicado, um agente 7B teria obtido 83,6% nas tarefas inéditas mais difíceis de ALFWorld e ScienceWorld. O texto sugere que recompensas por etapa podem ajudar a reduzir ações redundantes e a recuperação após erros; não informa, porém, detalhes suficientes para avaliar o protocolo ou comparar o resultado. Consulte a publicação original e confira nela as métricas, condições dos testes e definição das tarefas.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis