Um relato publicado em 27 de abril de 2026 descreve um kernel de multiplicação de matrizes (matmul) escrito em CUDA/PTX puro para o B200. Segundo o autor, ele foi 6% mais rápido que o cuBLAS quando M=N=K=8192.
Para avaliar o resultado, confirme que a implementação e o teste usam as mesmas dimensões, precisão numérica e condições de execução. Uma comparação justa também precisa considerar aquecimento, número de repetições e variabilidade das medições.
Ao estudar o código ou adaptar a técnica, valide a correção numérica e meça o desempenho no hardware e na carga de trabalho que pretende atender. Um ganho em uma configuração não garante o mesmo resultado em outras dimensões ou ambientes.
Se usar IA para analisar o material, compartilhe apenas trechos necessários e remova nomes, credenciais, dados de clientes e detalhes internos. Trate o código e as respostas do modelo como material a revisar, não como substituto de testes próprios.