Publicado em 25 de junho de 2026, o registro apresenta o iLLaDA, um modelo de linguagem de difusão mascarada com 8 bilhões de parâmetros, treinado do zero com atenção totalmente bidirecional.
O registro, publicado em 25 de junho de 2026, descreve o iLLaDA como um modelo de linguagem de difusão mascarada de 8 bilhões de parâmetros, treinado do zero com atenção totalmente bidirecional. Segundo o texto, o objetivo de difusão mascarada é mantido tanto no pré-treinamento quanto no ajuste fino supervisionado.
O material destaca a arquitetura e o objetivo de treinamento como um exemplo para engenheiros interessados em modelos de linguagem. Para conferir os detalhes e avaliar o resultado por conta própria, consulte a publicação original e verifique nela as especificações de treinamento e as evidências apresentadas; o registro não informa métricas de desempenho.