Publicado em 3 de julho de 2026, o resumo do artigo diz que HOLA combina um estado recorrente baseado na delta rule com um cache limitado e exato de key-values. Relata melhora na perplexidade do Wikitext e recall robusto de needles no RULER até 32k tokens.
Publicado em 3 de julho de 2026, o artigo descreve o HOLA, que combina um estado recorrente baseado na delta rule com um cache limitado e exato de key-values para atenção linear. Segundo o resumo, o desenho busca melhorar o recall de longo alcance mantendo o estado comprimido.
O artigo relata melhora na perplexidade do Wikitext e recall robusto de needles no RULER até 32k tokens. Para conferir os resultados, consulte o artigo original e verifique a configuração dos testes, as métricas e as comparações apresentadas; o resumo disponível não informa esses detalhes.