Publicado em 25 de setembro de 2026, o post descreve uma alternativa à projeção de valores na atenção: memória indexada por tokens, específica de cada camada, combinada a keys contextuais.
Em 25 de setembro de 2026, um post apresentou Memory Attention, que combina memória indexada por tokens, específica de cada camada, com keys contextuais para formar os valores da atenção. Segundo o texto, o cálculo desses valores passa a depender principalmente de consultas; a proposta pode permitir offloading para CPU e reduzir o KV cache.
O post aponta possíveis compensações de memória e computação para engenheiros que avaliam alternativas de attention. Para confirmar os detalhes e avaliar os resultados, consulte o post original e verifique nele a metodologia e as evidências, que não são especificadas no resumo disponível. Se usar IA para estudar o material, aplique a política da organização aos dados enviados.