Em 6 de novembro de 2025, a Perplexity descreveu kernels de expert parallelism para servir modelos MoE em várias GPUs da AWS usando EFA, sem GPUDirect Async.
Em 6 de novembro de 2025, a Perplexity apresentou uma abordagem de kernels de expert parallelism para servir grandes modelos MoE em várias GPUs da AWS por meio do EFA. Segundo a descrição, as operações de dispatch e combine agrupam tokens em escritas RDMA na GPU; uma thread proxy no host coordena as transferências junto ao grouped GEMM.
A proposta trata do serving MoE multinó quando o EFA não oferece GPUDirect Async. Para conferir os detalhes e o contexto técnico, consulte a publicação original e verifique nela a arquitetura e as condições descritas. Se usar IA para estudar ou aplicar o material, evite inserir dados sensíveis da organização e siga as políticas internas de tratamento de dados.