Publicado em 30 de janeiro de 2026, o relato apresenta o LMCache, uma extensão open source para serving de LLMs que gerencia estados KV entre GPUs, CPUs e discos locais.
Em 30 de janeiro de 2026, foi divulgado que o LMCache é uma extensão open source para serving de modelos de linguagem que gerencia o KV cache entre GPUs, CPUs e discos locais. Segundo o relato, pode reutilizar fragmentos de texto repetidos, não apenas prefixos. A reutilização de estados KV pode reduzir o trabalho de prefill e o uso de memória da GPU durante o serving.
Para avaliar o resultado, consulte o anúncio e a documentação original do projeto e confira como definem fragmentos reutilizáveis, prefill e as camadas de armazenamento. Verifique também as condições e medições apresentadas antes de concluir que os ganhos se aplicam à sua carga. Se usar IA para estudar ou aplicar o material, evite inserir dados pessoais ou confidenciais; a política da organização deve orientar o tratamento dos dados.