Pular para o conteúdo
Rota Nacional

Radar ·

Kascade reaproveita padrões de chaves em atenção esparsa

Publicado em 24 de dezembro de 2025, o relato descreve um método sem treinamento para reutilizar padrões de chaves entre camadas. A publicação informa ganhos de velocidade em GPUs H100 e pouca perda de precisão em benchmarks de contexto longo.

Em 24 de dezembro de 2025, uma publicação apresentou o Kascade, método de atenção esparsa sem treinamento que reutiliza padrões de chaves entre camadas. Segundo o relato, em GPUs H100 o método alcançou geração até 4,1 vezes mais rápida e prefill 2,2 vezes mais rápido, com pouca perda de precisão em benchmarks de contexto longo.

Os resultados relatados podem interessar a engenheiros que trabalham com inferência em contextos longos, mas não demonstram por si só desempenho em outros equipamentos ou cenários. Consulte a publicação original e verifique os benchmarks, as condições de teste e a definição das métricas antes de tirar conclusões. Se usar IA para estudar ou aplicar o método, evite incluir dados pessoais ou informações internas sem autorização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis