Uma publicação relata que preservar quatro tokens iniciais e uma janela de 64 tokens, sem treinamento, igualou ou superou modelos de atenção linear destilados em quase todos os benchmarks.
A publicação descreve uma estratégia de retenção de tokens como alternativa ao KV cache: manter os quatro tokens iniciais e uma janela de 64 tokens, sem treinamento adicional. Segundo o relato, o método igualou ou superou modelos de atenção linear destilados em quase todos os benchmarks avaliados.
O resultado sugere uma possibilidade de reduzir a dependência do KV cache sem post-training, mas não demonstra que a estratégia funcione igualmente em toda tarefa ou implantação. Para estudar ou testar a ideia com IA, evite inserir dados pessoais ou confidenciais: use exemplos sintéticos ou anonimizados e confira a política de retenção e acesso da ferramenta.