Pular para o conteúdo
Rota Nacional

Radar ·

Dust: treino de transformers sem gradientes por meio de perturbações de ativação

Radar: a publicação descreve Dust, um método de otimização zeroth-order que usa perturbações paralelas de ativações como população virtual para pré-treinar transformers, com experimentos de escala e comparações com backpropagation e estratégias evolutivas.

A publicação, datada de 5 de outubro de 2026, descreve Dust, um método de otimização zeroth-order que usa perturbações paralelas de ativações como uma “população virtual” para pré-treinar transformers. Segundo o texto, o trabalho relata experimentos de escala e comparações com backpropagation e com um método de estratégias evolutivas.

O trabalho apresenta Dust como alternativa prática a backpropagation e relata como o treinamento zeroth-order se comporta com o aumento do modelo e do compute. A Rota Nacional não oferece treinamento sem gradientes; este item é apenas informativo. Para conferir os resultados, consulte a publicação original pela fonte registrada no Radar, verifique as métricas, a metodologia e as condições dos experimentos. Se usar IA para estudar o material, não cole trechos com dados pessoais.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 10,00.

Testar grátis