Artigo de 30 de junho de 2026 avalia a escala da learning rate em modelos no estilo GPT-2 e relata uma tendência ascendente para a taxa ótima.
Publicado em 30 de junho de 2026, o artigo avalia como a learning rate escala no treino de modelos no estilo GPT-2, com tamanhos entre 22 milhões e 707 milhões de parâmetros e volumes de treino entre 5 bilhões e 100 bilhões de tokens. O resumo relata uma tendência ascendente para a learning rate ótima.
O texto também alerta que extrapolar a taxa de execuções menores pode exigir considerar a não linearidade e a effective learning rate. Para verificar o resultado, consulte o artigo original pelo título e confira método, configurações e resultados; o resumo disponível não informa a magnitude da tendência.