HOLA combina estado recorrente e cache KV limitado
Publicado em 6 de julho de 2026, o post apresenta o HOLA, que combina estado recorrente e um pequeno cache KV para memória exata. Segundo o texto, a abordagem reduz a perplexidade em 16,1% e mantém recuperação robusta em 32 mil tokens.
Publicado em 6 de julho de 2026, o post descreve o HOLA, método que combina um estado recorrente com um pequeno cache KV para manter memória exata. Tokens com alto erro de previsão são direcionados ao cache. O projeto investiga se esse buffer limitado pode melhorar a recuperação em contextos longos em modelos de atenção linear.
Segundo o post, o método reduz a perplexidade em 16,1% e mantém recuperação robusta em 32 mil tokens. Para avaliar esses resultados, consulte o post original e confira nele a descrição do método, as condições de avaliação e as métricas; o resumo disponível não informa esses detalhes.