Artigo publicado em 19 de abril de 2026 apresenta o Mixture-of-Depths Attention (MoDA), mecanismo que permite a cabeças de atenção acessar pares key-value da camada atual e de camadas anteriores.
Publicado em 19 de abril de 2026, o artigo apresenta o Mixture-of-Depths Attention (MoDA). Nesse mecanismo, cada cabeça de atenção pode acessar pares key-value da sequência na camada atual e pares depth key-value de camadas anteriores. A proposta aborda a degradação de sinais em modelos de linguagem de grande porte mais profundos.
O material aponta o MoDA como uma alternativa para engenheiros que exploram arquiteturas de atenção e a reutilização de features anteriores. Para avaliar a proposta, consulte o artigo original e verifique nele a descrição do método, os experimentos e os resultados; o resumo disponível não especifica esses detalhes. Se usar IA para estudar o tema, evite enviar dados internos ou confidenciais.