Publicado em 12 de março de 2026, o artigo apresenta uma variante de atenção que exclui o próprio vetor de valor de cada token e relata desempenho superior em modelos de linguagem de até 2,7 bilhões de parâmetros.
Publicado em 12 de março de 2026, o artigo descreve a exclusive self-attention: o mecanismo restringe a atenção a informações ortogonais ao vetor de valor de cada token. A proposta modifica a self-attention padrão usada em modelagem de linguagem.
Segundo o resumo disponível, a variante superou a self-attention padrão em modelos de até 2,7 bilhões de parâmetros, e os ganhos cresceram com o tamanho da sequência. Esses resultados são atribuídos ao artigo; o material fornecido não detalha métricas, configuração experimental ou limitações. Para avaliar as conclusões, consulte o artigo original e confira seus métodos, tabelas e condições de comparação. Se usar IA para estudá-lo, evite inserir dados pessoais ou documentos confidenciais sem antes verificar a política da organização.