Uma análise prática do treinamento em FP4 de modelos Mixture-of-Experts de grande escala em GPUs Hopper destaca memória de ativações e comunicação expert-parallel como gargalos.
O material aborda o treinamento prático em FP4 de modelos Mixture-of-Experts (MoE) de grande escala em GPUs Hopper. Ele aponta dois gargalos: a memória usada pelas ativações e a comunicação entre especialistas no esquema expert-parallel.
Esses pontos são relevantes para engenheiros que estudam o uso de memória e a comunicação durante o treinamento MoE em grande escala. Se você usar IA para estudar ou aplicar o conteúdo, evite enviar dados internos, credenciais ou informações pessoais; substitua-os por exemplos fictícios ou anonimizados.