Pular para o conteúdo
Rota Nacional

Radar ·

Pré-treinamento de um MoE 30B-A3B escalado de 16 para 512 GPUs B200

Relato de escalonamento com escalabilidade quase linear e MFU de 35,3%, usando testes em pequena escala para reduzir o espaço de busca antes de alocar mais GPUs.

Segundo o briefing do Radar publicado em 5 de outubro de 2026, uma empresa de IA descreveu como escalou o pré-treinamento de um modelo MoE 30B-A3B de 16 para 512 GPUs B200. O relato informa escalabilidade quase linear e MFU (utilização de FLOPs do modelo) de 35,3%.

A abordagem central é reduzir o espaço de busca em pequena escala, testando configurações de treinamento antes de aumentar a quantidade de GPUs. O texto apresenta isso como uma forma prática de validar escolhas antes de alocar mais hardware. Os detalhes completos da metodologia estão no original, que deve ser consultado para confirmar os números e as condições do teste.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 10,00.

Testar grátis