Pular para o conteúdo
Rota Nacional

Radar ·

Gradientes BF16 no FlashAttention-3 podem crescer no fim do treinamento

Relato sobre um transformer de 450 milhões de parâmetros treinado com FlashAttention-3 em BF16: a norma do gradiente subiu 1.000× após 25 bilhões de tokens, com loss maior que na atenção em FP32 e sem NaNs.

Segundo o resumo arquivado no Radar em 4 de outubro de 2026, um artigo relata que um transformer de 450 milhões de parâmetros treinado com FlashAttention-3 em BF16 teve aumento de 1.000× na norma do gradiente após 25 bilhões de tokens. Ao final, o modelo terminou com loss maior do que o treino com atenção em FP32, sem ocorrência de NaNs. O trecho também menciona uma mitigação: recalcular em FP32 o backward da atenção de duas camadas. O texto arquivado está cortado nesse ponto, então o resultado dessa mitigação deve ser conferido na fonte original.

Para equipes que treinam modelos com atenção BF16 fundida, o achado é um alerta sobre estabilidade no fim do treinamento. A Rota Nacional não treina modelos nem corrige kernels de atenção; ela oferece uma API compatível com OpenAI e Anthropic para inferência. Se alguém usar IA para estudar este material, deve tirar do prompt logs, nomes, e-mails e identificadores internos, pois a plataforma detecta CPF, CNPJ, e-mail, telefone e nomes antes de qualquer modelo rodar. Para verificar a relevância, consulte o artigo original e compare as curvas de norma do gradiente com seus próprios treinos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 10,00.

Testar grátis