Prévia de paper apresenta um treinamento de etapa única com hiperparâmetros fixos e relata acurácias médias de 54,9% e 64,3% em dois modelos de raciocínio de 1,5B.
Publicado em 4 de janeiro de 2026, o registro resume o JustRL, uma abordagem de treinamento por aprendizado por reforço (RL) em etapa única, com hiperparâmetros fixos, aplicada a dois modelos de raciocínio de 1,5B. A prévia relata acurácias médias de 54,9% e 64,3%; o texto não especifica aqui tarefas, conjuntos de avaliação ou condições experimentais.
O trabalho oferece um baseline para comparar receitas mais simples de RL com abordagens mais complexas. Para verificar o resultado, consulte o paper original e confira a configuração dos experimentos, as métricas e os conjuntos de avaliação antes de comparar as acurácias. Se usar IA para estudar ou aplicar o material, não envie dados confidenciais da organização sem autorização; use conteúdo público ou devidamente anonimizado.