Método sem treinamento reaproveita padrões de chaves entre camadas. A publicação relata geração até 4,1× mais rápida e prefill 2,2× mais rápido em GPUs H100, com pouca perda de precisão em benchmarks de contexto longo.
O Kascade é um método de atenção esparsa sem treinamento que reutiliza padrões de chaves entre camadas. A publicação relata, em GPUs H100, geração até 4,1× mais rápida e prefill 2,2× mais rápido, com pouca perda de precisão em benchmarks de contexto longo.
Esses números são resultados relatados, não uma garantia para todo modelo, hardware ou tarefa. Ao avaliar o método, confira as condições dos benchmarks e compare com uma linha de base equivalente.
Teste também seus próprios casos de contexto longo. Meça separadamente o tempo de prefill e o de geração e avalie a qualidade das respostas, para verificar se a troca entre velocidade e precisão serve ao seu uso.
Se usar IA para estudar ou aplicar a técnica, evite enviar prompts com dados pessoais ou informações internas sem autorização. Registre os resultados e os parâmetros do teste para tornar as comparações reproduzíveis.