Um post afirma que o uso de KV cache caiu de 389.000 bytes para 890 bytes por token em três anos. Alega que um artigo linkado explica a abordagem com diagramas.
Publicado em 13 de setembro de 2026, o post atribui a um sistema de IA uma redução do KV cache de 389.000 bytes para 890 bytes por token ao longo de três anos. Esses números são alegações do post; o material fornecido não traz medições independentes nem detalhes metodológicos para confirmá-los.
O texto diz que o artigo linkado explica a abordagem com diagramas e observa que o tamanho do KV cache pode afetar a memória e o custo de servir agentes com contexto longo. Para verificar a alegação, consulte o artigo citado no post e confira como os valores foram medidos, em quais condições e com que comparação; esses detalhes não constam no material fornecido.