Megatron-LM: paralelismo para treinar grandes modelos
Paper de 2019 descreve como dividir os pesos de modelos de linguagem com bilhões de parâmetros entre GPUs, para treinar modelos cujos pesos não cabem em uma única GPU.
O paper de 2019 sobre Megatron-LM descreve o uso de paralelismo de modelo para treinar modelos de linguagem com bilhões de parâmetros. A técnica divide os pesos do modelo entre GPUs, abordando o caso em que eles não cabem em uma única GPU.
O registro deste Radar foi publicado em 23 de abril de 2026; essa é a data do bookmark, não a do paper. Para conferir o resultado, consulte a publicação original e verifique nela a data, o escopo e a descrição da técnica. Se usar IA para estudar ou aplicar o material, evite enviar dados organizacionais sensíveis e siga as políticas de proteção da sua organização.