Artigo relata o treinamento de um Transformer de 8 bilhões de parâmetros com difusão mascarada bidirecional em 12 trilhões de tokens e compara seus resultados com modelos autoregressivos.
Publicado em 27 de junho de 2026, o artigo descreve o treinamento do iLLaDA, um Transformer de 8 bilhões de parâmetros com difusão mascarada bidirecional, usando 12 trilhões de tokens. O trabalho também relata instruction tuning por difusão. Em benchmarks, o modelo obteve pontuações superiores às do LLaDA; ainda assim, o iLLaDA-Instruct ficou atrás do Qwen2.5 Instruct sem alinhamento por RL.
Os detalhes de treinamento e ajuste permitem comparar modelos de difusão com abordagens autoregressivas. Para conferir métodos, métricas e conclusões, consulte o artigo original e verifique se os resultados citados correspondem aos benchmarks e às condições nele descritos. Se usar IA para estudar ou aplicar o material, evite inserir dados pessoais ou documentos confidenciais; confira as respostas com o texto original.