Transformers recorrentes em blocos processam sequências com complexidade linear
Uma arquitetura aplica uma camada Transformer recorrentemente a blocos de tokens, combinando self-attention e cross-attention para processar sequências com complexidade linear em relação ao comprimento.
O artigo apresenta os Block-Recurrent Transformers, que aplicam uma camada Transformer de forma recorrente ao longo de uma sequência. A célula recorrente opera em blocos de tokens e usa self-attention e cross-attention. Segundo o texto, essa abordagem tem complexidade linear em relação ao comprimento da sequência.
A recorrência em blocos oferece uma alternativa arquitetural para o processamento de sequências longas; o material não afirma que ela seja superior em todos os cenários nem detalha resultados comparativos. Para estudar ou aplicar a ideia com IA, evite enviar dados pessoais ou confidenciais desnecessários e use dados sintéticos ou anonimizados quando possível.