Em publicação de 27 de abril de 2026, Paul Chan afirma que um kernel próprio de multiplicação de matrizes no B200 foi 6% mais rápido que o cuBLAS em uma configuração específica.
Em 27 de abril de 2026, Paul Chan descreveu um kernel de multiplicação de matrizes (matmul) escrito em CUDA/PTX puro para a GPU B200. Segundo o autor, no teste com M=N=K=8192, o kernel foi 6% mais rápido que o cuBLAS. O resultado relatado se refere a essa configuração; o texto não estabelece que a vantagem se aplique a outros tamanhos ou condições.
A publicação indica um blog técnico e um repositório de código para consulta e análise por engenheiros. Para verificar o resultado, consulte os materiais originais e confira o código, a configuração do teste e o método de comparação antes de tirar conclusões ou aplicar a otimização.