Publicado em 26 de fevereiro de 2026, o resumo apresenta uma estratégia para workloads de inferência com comprimentos de sequência variáveis: definir um tamanho máximo, preencher os inputs até o intervalo mais próximo e criar uma família de CUDA graphs. Segundo o autor, isso evita recompilações.
Publicado em 26 de fevereiro de 2026, o post recomenda definir um tamanho máximo de input e preencher cada input até o intervalo mais próximo. A proposta é criar uma família de CUDA graphs para acomodar diferentes comprimentos de sequência em workloads de inferência variáveis; segundo o autor, a estratégia evita recompilações.
Para avaliar a recomendação, consulte o post original e compare, no workload relevante, o comportamento com e sem padding, incluindo a ocorrência de recompilações. O resumo não informa valores de desempenho nem detalhes de implementação, portanto esses resultados precisam ser verificados no material original e no ambiente de uso.