Pular para o conteúdo
Rota Nacional

Radar ·

RL de longo horizonte: PPO ou GRPO?

Post publicado no Zhihu em 24 de junho de 2026 compara o uso de GRPO e PPO em tarefas de aprendizado por reforço com LLMs, destacando desafios de atribuição de crédito em rollouts agentic longos e ruidosos.

Um post no Zhihu, publicado em 24 de junho de 2026, argumenta que o baseline amostrado do GRPO se ajusta a tarefas curtas de aprendizado por reforço com LLMs. O texto examina a escolha entre evitar um crítico com GRPO e usar modelagem de valor com PPO.

Para rollouts agentic mais longos e ruidosos, segundo o post, a atribuição de crédito fica mais difícil, o que pode tornar útil o modelo de valor do PPO. Consulte o post original no Zhihu e confira nele os argumentos e o contexto; o resumo disponível não informa experimentos ou resultados quantitativos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis