Pular para o conteúdo
Rota Nacional

Radar ·

HOLA adiciona cache de 64 tokens à atenção linear

Uma postagem descreve uma métrica de surpresa de tokens sem parâmetros e um cache de 64 tokens para reduzir o esquecimento catastrófico em atenção linear. Ela afirma superar baselines de atenção completa.

A postagem apresenta HOLA, uma abordagem que combina uma métrica de surpresa de tokens sem parâmetros com um cache de 64 tokens para lidar com o esquecimento catastrófico em modelos com atenção linear. Segundo a fonte, o método supera baselines de atenção completa; não são fornecidos detalhes sobre a configuração ou as métricas dessa comparação.

O tema interessa a engenheiros que equilibram custo de inferência, recuperação de memória e tamanho do cache. A afirmação de desempenho deve ser avaliada no contexto da tarefa e dos testes relatados. Se usar IA para estudar ou aplicar a ideia, evite enviar dados internos, identificadores ou credenciais; use exemplos sintéticos ou dados autorizados e aplique as regras de privacidade da organização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis