Pular para o conteúdo
Rota Nacional

Radar ·

iLLaDA treina modelo de difusão de 8B

Artigo relata o treinamento de um Transformer de 8 bilhões de parâmetros com difusão mascarada bidirecional em 12 trilhões de tokens e compara seus resultados com modelos autoregressivos.

Publicado em 27 de junho de 2026, o artigo descreve o treinamento do iLLaDA, um Transformer de 8 bilhões de parâmetros com difusão mascarada bidirecional, usando 12 trilhões de tokens. O trabalho também relata instruction tuning por difusão. Em benchmarks, o modelo obteve pontuações superiores às do LLaDA; ainda assim, o iLLaDA-Instruct ficou atrás do Qwen2.5 Instruct sem alinhamento por RL.

Os detalhes de treinamento e ajuste permitem comparar modelos de difusão com abordagens autoregressivas. Para conferir métodos, métricas e conclusões, consulte o artigo original e verifique se os resultados citados correspondem aos benchmarks e às condições nele descritos. Se usar IA para estudar ou aplicar o material, evite inserir dados pessoais ou documentos confidenciais; confira as respostas com o texto original.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis