Pular para o conteúdo
Rota Nacional

Radar ·

Kernel CUDA/PTX supera cuBLAS no B200

Em publicação de 27 de abril de 2026, Paul Chan afirma que um kernel próprio de multiplicação de matrizes no B200 foi 6% mais rápido que o cuBLAS em uma configuração específica.

Em 27 de abril de 2026, Paul Chan descreveu um kernel de multiplicação de matrizes (matmul) escrito em CUDA/PTX puro para a GPU B200. Segundo o autor, no teste com M=N=K=8192, o kernel foi 6% mais rápido que o cuBLAS. O resultado relatado se refere a essa configuração; o texto não estabelece que a vantagem se aplique a outros tamanhos ou condições.

A publicação indica um blog técnico e um repositório de código para consulta e análise por engenheiros. Para verificar o resultado, consulte os materiais originais e confira o código, a configuração do teste e o método de comparação antes de tirar conclusões ou aplicar a otimização.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis