Retrieval esparso reduz uso de KV cache em contexto longo
Publicação de 9 de junho de 2026 resume um paper sobre previsão de chunks de KV cache relevantes: os selecionados ficam na GPU e os demais são descarregados. O relato aponta footprint médio de 13,5% e redução de memória de até 90% em contexto de 500K.
Em 9 de junho de 2026, o Radar registrou um post que descreve um paper sobre retrieval esparso para KV cache. A abordagem prevê quais chunks anteriores serão necessários, mantém os selecionados na GPU e descarrega os demais. Segundo o relato, o footprint médio do KV cache é de 13,5%, com redução de memória de até 90% em contexto de 500K.
O resultado pode interessar a engenheiros que avaliam trade-offs de memória em inferência com contexto longo; não é, por si só, uma garantia para outras cargas ou configurações. Consulte o paper original e confira como foram definidos o contexto, a memória e as condições de comparação antes de aplicar os números ao seu sistema. Se usar IA para estudar o material, evite inserir dados organizacionais sensíveis.