Pular para o conteúdo
Rota Nacional

Radar ·

llama.cpp adiciona suporte a Multi-Token Prediction

Um pull request do llama.cpp adiciona suporte a heads de MTP. O autor relata que o Qwen3.6-27B alcançou 65 tokens por segundo em uma RTX 3090, ante 38 com MTP ativado.

Publicado em 17 de maio de 2026, o relato informa que um pull request do llama.cpp adiciona suporte a heads de Multi-Token Prediction (MTP), capazes, segundo o post, de prever vários tokens por execução. Engenheiros que servem modelos compatíveis podem avaliar a técnica para aumentar o throughput de inferência.

O autor relata 65 tokens por segundo para o Qwen3.6-27B em uma RTX 3090 com MTP ativado, contra 38 na comparação apresentada. Para verificar o resultado, consulte o pull request e o post original e confira as condições do teste; o relato não detalha outros parâmetros de benchmark.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis