Uma postagem descreve uma métrica de surpresa de tokens sem parâmetros e um cache de 64 tokens para reduzir o esquecimento catastrófico em atenção linear. Ela afirma superar baselines de atenção completa.
A postagem apresenta HOLA, uma abordagem que combina uma métrica de surpresa de tokens sem parâmetros com um cache de 64 tokens para lidar com o esquecimento catastrófico em modelos com atenção linear. Segundo a fonte, o método supera baselines de atenção completa; não são fornecidos detalhes sobre a configuração ou as métricas dessa comparação.
O tema interessa a engenheiros que equilibram custo de inferência, recuperação de memória e tamanho do cache. A afirmação de desempenho deve ser avaliada no contexto da tarefa e dos testes relatados. Se usar IA para estudar ou aplicar a ideia, evite enviar dados internos, identificadores ou credenciais; use exemplos sintéticos ou dados autorizados e aplique as regras de privacidade da organização.