O paper DAPO informa que o GRPO padrão obteve 30% no AIME em seus experimentos; com a adição de algumas técnicas, o resultado relatado subiu para 50%.
Publicado em 1º de março de 2026, o relato sobre o paper DAPO compara resultados do GRPO padrão e de uma configuração com algumas técnicas adicionais no AIME: 30% e 50%, respectivamente. Esses números são resultados informados pelos autores, não uma garantia de desempenho em outros cenários.
A comparação pode interessar a engenheiros que avaliam métodos de treinamento por aprendizado por reforço. Para verificar o achado, consulte o paper original e confira a configuração experimental, as técnicas adicionadas e as condições da avaliação antes de comparar ou reproduzir os resultados.