Publicação de 24 de setembro de 2025 descreve uma formulação que trata tokens pré-misturados e (V·Wo) como um expert de FFN, unificando Attention-MoE e FFN-MoE com experts compartilhados.
Em 24 de setembro de 2025, uma publicação apresentou um artigo que propõe tratar tokens pré-misturados e (V·Wo) como um expert de FFN. A formulação unifica Attention-MoE e FFN-MoE com experts compartilhados; segundo a publicação, reduz a perplexity com compute semelhante.
A abordagem pode ajudar engenheiros a comparar designs esparsos de attention e FFN. Para conferir o escopo e os resultados, consulte o artigo original e compare a formulação e as métricas nele apresentadas com o resumo da publicação; o material fornecido não detalha valores ou condições experimentais.