TPA propõe reduzir memória do cache KV com componentes de baixo rank
Artigo publicado em 27 de outubro de 2025 propõe a Tensor Product Attention, que representa queries, keys e values com componentes contextuais de baixo rank para buscar reduzir o consumo de memória do cache KV durante a inferência.
Publicado em 27 de outubro de 2025, o artigo propõe a Tensor Product Attention (TPA). A abordagem usa decomposições tensoriais para representar queries, keys e values por componentes contextuais de baixo rank, com o objetivo de reduzir a memória ocupada pelo cache KV durante a inferência.
Caches KV menores podem ajudar engenheiros a administrar a memória de inferência de modelos de linguagem ao lidar com sequências de entrada mais longas. Para avaliar o alcance da proposta, consulte o artigo original e verifique nele os métodos, as medições e as condições dos resultados; o resumo disponível não informa esses detalhes.