Publicação de 29 de abril de 2026 compara uma arquitetura de atenção com MQA e KV compartilhado ao MLA, destacando uma troca entre eficiência de cache e computação por token.
Em 29 de abril de 2026, uma publicação descreveu uma mudança de arquitetura no modelo abordado: MQA com KV compartilhado, 128 (64) cabeças de consulta e dimensão de 512 por cabeça. O texto contrapõe esse desenho ao MLA, apresentado como uma abordagem de baixa ordem com foco no cache KV.
A comparação aponta uma troca: eficiência no cache KV de um lado; mais computação por token e capacidade de representação do outro. Para conferir o alcance da afirmação, consulte a publicação original e verifique nela a configuração e os termos usados; o resumo disponível não apresenta medições de desempenho nem resultados de benchmark.