Publicadas em 13 de maio de 2026, as notas apresentam técnicas e componentes de sistemas voltados a melhorar a inferência e o serving de modelos de linguagem.
As notas de aula, publicadas em 13 de maio de 2026, cobrem SmoothQuant, AWQ, kernels de inferência INT4, pruning e sparsity, MoE, PagedAttention, FlashAttention, speculative decoding e batching. O escopo declarado é o uso dessas técnicas e componentes para melhorar a inferência e o serving de LLMs; o material não informa resultados quantitativos nem compara métodos.
Consulte a fonte original para verificar as explicações e referências de cada tópico antes de aplicar qualquer técnica. Se usar IA para estudar o material ou analisar dados da sua organização, evite enviar informações pessoais ou confidenciais sem autorização e aplique a política de proteção de dados da organização.