Post de 9 de fevereiro de 2026 descreve um desenho de LatentMoE com paralelismo de heads e relata até 1,61× de speedup sobre MoE padrão com paralelismo de experts.
Publicado em 9 de fevereiro de 2026, o post descreve um desenho de Multi-Head LatentMoE com paralelismo de heads. Cada token é dividido em heads, distribuídas entre GPUs; em cada GPU, o routing e o trabalho dos experts são executados localmente.
O post afirma que o método alcança até 1,61× de speedup frente a um MoE padrão com paralelismo de experts e mantém constante a comunicação à medida que cresce o número de experts. O texto aponta possível redução do overhead de comunicação e melhor balanceamento entre GPUs. Para confirmar o resultado, consulte o post original e verifique as condições e métricas dos benchmarks; o resumo disponível não detalha a metodologia.