Artigo publicado em 22 de setembro de 2026 apresenta um método para Transformers alocarem compute a posições específicas da sequência, respeitando um orçamento por camada.
Publicado em 22 de setembro de 2026, o artigo apresenta o Mixture-of-Depths, método para modelos de linguagem Transformer alocarem compute a posições específicas da sequência entre as camadas. A proposta limita quantos tokens participam dos cálculos de self-attention e MLP em cada camada, permitindo variar o compute por token dentro de um orçamento por camada.
O material descreve a abordagem; o resumo disponível não informa resultados de avaliação. Para verificar o método e suas evidências, consulte o artigo original e examine a metodologia e os resultados nele apresentados. Se usar IA para estudar ou aplicar a ideia, evite enviar dados pessoais ou informações internas sem necessidade e siga a política de dados da organização.