HySparse2 explora compartilhamento de KV em contextos longos
Publicado em 23 de setembro de 2026, o relato descreve dois níveis de compartilhamento de KV para reduzir o custo de prefill e o tamanho do cache, além de melhorar o retrieval em contextos extensos.
Em 23 de setembro de 2026, um post apresentou o HySparse2, que combina compartilhamento de KV entre decoders com reuso entre camadas sparse e de full attention. O objetivo do desenho é reduzir FLOPs de prefill e o tamanho do KV cache em inferência com contexto longo.
Segundo o relato, em workloads agentic com contexto crescente, o HySparse2 obteve melhores scores de retrieval que a arquitetura Hybrid SWA do MiMo-V2.6 na avaliação com 1 milhão de tokens. Consulte o post original para os detalhes do método e da avaliação; trate esses resultados como os reportados pela fonte e verifique configurações e métricas antes de compará-los com outros sistemas.