Pular para o conteúdo
Rota Nacional

Radar ·

DFlash e DDTree rodam Qwen3.6-27B em uma RTX 3090

Post publicado em 23 de abril de 2026 relata 73 tokens por segundo para o Qwen3.6-27B em uma única RTX 3090, com speculative decoding usando DFlash e DDTree. O autor atribui a compatibilidade à correspondência da arquitetura e das dimensões de camadas e heads com o Qwen3.5, mas informa throughput de

Publicado em 23 de abril de 2026, o post relata 73 tokens por segundo para o Qwen3.6-27B em uma única RTX 3090, usando speculative decoding com DFlash e DDTree. Segundo o autor, a stack consegue carregar o modelo porque sua arquitetura e as dimensões de camadas e heads correspondem às do Qwen3.5; ainda assim, o throughput é menor.

O caso ilustra como a compatibilidade arquitetural pode permitir speculative decoding em GPUs de consumo antes de haver suporte dedicado upstream. Para verificar os números e as condições do teste, consulte o post original e confira o hardware, a configuração e a métrica informados; os dados disponíveis aqui não detalham esses parâmetros.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis