llama.cpp adiciona suporte a Multi-Token Prediction
Um pull request do llama.cpp adiciona suporte a heads de MTP. O autor relata que o Qwen3.6-27B alcançou 65 tokens por segundo em uma RTX 3090, ante 38 com MTP ativado.
Publicado em 17 de maio de 2026, o relato informa que um pull request do llama.cpp adiciona suporte a heads de Multi-Token Prediction (MTP), capazes, segundo o post, de prever vários tokens por execução. Engenheiros que servem modelos compatíveis podem avaliar a técnica para aumentar o throughput de inferência.
O autor relata 65 tokens por segundo para o Qwen3.6-27B em uma RTX 3090 com MTP ativado, contra 38 na comparação apresentada. Para verificar o resultado, consulte o pull request e o post original e confira as condições do teste; o relato não detalha outros parâmetros de benchmark.