Publicado em 27 de janeiro de 2026, o registro descreve um quantizer MXFP8 em CuTeDSL para GPUs B200 e relata throughput acima de 6 TB/s.
Um post publicado em 27 de janeiro de 2026 descreve um quantizer MXFP8 escrito em CuTeDSL para a GPU B200. A técnica grava fatores de escala diretamente no layout compactado do Blackwell, evitando uma etapa adicional de packing antes dos GEMMs seguintes. O resultado informado é throughput acima de 6 TB/s.
O exemplo trata de projeto de kernels e da preparação de dados em GPUs Blackwell; não são informados detalhes de metodologia de medição ou resultados comparativos. Para conferir o alcance da afirmação, consulte o post original e verifique a configuração do teste, a métrica e as condições de medição. Se usar IA para estudar ou adaptar o material, evite inserir dados internos ou confidenciais sem aplicar antes as políticas da sua organização.