Publicação datada de 1º de outubro de 2026 relata 890 bytes de KV cache global por token e um cache persistente oito vezes menor em um modelo de linguagem.
Uma publicação de 1º de outubro de 2026 afirma que um modelo de linguagem usa 890 bytes de KV cache global por token e um cache persistente oito vezes menor. O texto cita Causal Encoder-Decoder, Compressed Sparse Attention e SWA Bounded Replay como técnicas relacionadas. São afirmações da publicação, não resultados verificados independentemente neste resumo.
As reduções de cache e as técnicas de atenção podem interessar a engenheiros que otimizam custos de inferência. Consulte a publicação original para entender seus métodos e contexto; antes de aplicar as alegações, procure detalhes de avaliação e compare-as com documentação técnica ou testes próprios. Se usar IA para analisar material interno sobre o tema, evite inserir dados pessoais ou confidenciais sem autorização e aplique a política da organização.