Publicação de 12 de junho de 2026 relata um método que cria KV caches compactos no espaço latente e preserva saídas de attention por head. Em alguns datasets, a compactação chegou a 50× em segundos, com perda mínima de qualidade.
Uma publicação datada de 12 de junho de 2026 descreve o uso de Attention Matching para criar KV caches compactos no espaço latente. A proposta busca preservar as saídas de attention de cada head sem recorrer a um treinamento end-to-end lento.
Segundo o relato, em alguns datasets o método alcançou compactação de até 50× em segundos, com perda mínima de qualidade. A publicação aponta que caches menores podem reduzir o uso de memória de modelos de linguagem; os resultados mencionados são específicos aos datasets avaliados. Consulte a publicação original para verificar método, condições dos testes e métricas antes de aplicar a técnica.