Switching Linear Attention alterna entre múltiplos mapas lineares
Radar: o paper SwiLA, da COLM 2026, propõe alternar entre múltiplos mapas lineares e discute o trade-off entre expressividade da atenção e custo de memória do KV cache.
A publicação de 5 de outubro de 2026 descreve o Switching Linear Attention (SwiLA), um paper da COLM 2026 que alterna entre múltiplos mapas lineares. O texto contrasta o estado de tamanho fixo da linear attention com o KV cache da softmax attention, que cresce com o comprimento da sequência. A proposta destaca o trade-off entre a expressividade da attention e o custo de memória de um KV cache crescente.
A fonte não detalha resultados experimentais nem implementação. Para verificar as afirmações, consulte o paper original na COLM 2026 e compare a definição de estado e os dados de memória com a descrição aqui apresentada. A Rota Nacional não implementa o SwiLA e este item não afirma que a plataforma resolva o problema de memória descrito. Se você usar IA para estudar o material, não cole dados pessoais, credenciais ou documentos internos nos prompts.