Kascade reaproveita padrões de chaves em atenção esparsa
Publicado em 24 de dezembro de 2025, o relato descreve um método sem treinamento para reutilizar padrões de chaves entre camadas. A publicação informa ganhos de velocidade em GPUs H100 e pouca perda de precisão em benchmarks de contexto longo.
Em 24 de dezembro de 2025, uma publicação apresentou o Kascade, método de atenção esparsa sem treinamento que reutiliza padrões de chaves entre camadas. Segundo o relato, em GPUs H100 o método alcançou geração até 4,1 vezes mais rápida e prefill 2,2 vezes mais rápido, com pouca perda de precisão em benchmarks de contexto longo.
Os resultados relatados podem interessar a engenheiros que trabalham com inferência em contextos longos, mas não demonstram por si só desempenho em outros equipamentos ou cenários. Consulte a publicação original e verifique os benchmarks, as condições de teste e a definição das métricas antes de tirar conclusões. Se usar IA para estudar ou aplicar o método, evite incluir dados pessoais ou informações internas sem autorização.