Pular para o conteúdo
Rota Nacional

Radar ·

Kernels MoE exploram uso do AWS EFA

Em 6 de novembro de 2025, a Perplexity descreveu kernels de expert parallelism para servir modelos MoE em várias GPUs da AWS usando EFA, sem GPUDirect Async.

Em 6 de novembro de 2025, a Perplexity apresentou uma abordagem de kernels de expert parallelism para servir grandes modelos MoE em várias GPUs da AWS por meio do EFA. Segundo a descrição, as operações de dispatch e combine agrupam tokens em escritas RDMA na GPU; uma thread proxy no host coordena as transferências junto ao grouped GEMM.

A proposta trata do serving MoE multinó quando o EFA não oferece GPUDirect Async. Para conferir os detalhes e o contexto técnico, consulte a publicação original e verifique nela a arquitetura e as condições descritas. Se usar IA para estudar ou aplicar o material, evite inserir dados sensíveis da organização e siga as políticas internas de tratamento de dados.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis