Roteamento de Experts com Eficiência de Memória para Treinamento de MoE
Artigo no arXiv, datado de 7 de outubro de 2026, que propõe métodos para reduzir o pico de memória no treinamento distribuído de Mixture-of-Experts, com foco no dispatcher all-to-all.
O artigo indicado no Radar trata do treinamento distribuído de modelos Mixture-of-Experts (MoE). Segundo a fonte, o pipeline de dispatch do MoE domina o uso de memória, e o foco está no dispatcher all-to-all, que constrói de uma vez o buffer completo expandido por top-k. Os autores propõem métodos para reduzir o pico de memória nesse processo.
A relevância indicada é para equipes que treinam modelos MoE grandes e encontram limites de memória no dispatch de experts entre dispositivos. O resumo disponível não detalha resultados numéricos nem a configuração testada, por isso não os reproduzimos aqui. Para conferir o conteúdo, localize o artigo original no arXiv pelo título e leia as seções de método e de avaliação.