Publicado em 11 de julho de 2026, o relato apresenta uma arquitetura híbrida de 9 bilhões de parâmetros para contextos longos e informa bons resultados em benchmarks, com inferência escalável até 1 milhão de tokens.
O relato descreve a MiniCPM-SALA, arquitetura híbrida de 9 bilhões de parâmetros que combina sparse attention (atenção esparsa) e linear attention (atenção linear) para lidar com contextos longos. Segundo o texto, a abordagem obteve bons resultados em benchmarks de contexto longo e permite inferência escalável até 1 milhão de tokens.
O paper explora como combinar mecanismos de atenção para equilibrar qualidade de contexto, computação e uso de memória. Para conferir os resultados, consulte o paper original e verifique nele os métodos, benchmarks e condições de avaliação; o relato não especifica esses detalhes.