Post publicado em 23 de abril de 2026 relata 73 tokens por segundo para o Qwen3.6-27B em uma única RTX 3090, com speculative decoding usando DFlash e DDTree. O autor atribui a compatibilidade à correspondência da arquitetura e das dimensões de camadas e heads com o Qwen3.5, mas informa throughput de
Publicado em 23 de abril de 2026, o post relata 73 tokens por segundo para o Qwen3.6-27B em uma única RTX 3090, usando speculative decoding com DFlash e DDTree. Segundo o autor, a stack consegue carregar o modelo porque sua arquitetura e as dimensões de camadas e heads correspondem às do Qwen3.5; ainda assim, o throughput é menor.
O caso ilustra como a compatibilidade arquitetural pode permitir speculative decoding em GPUs de consumo antes de haver suporte dedicado upstream. Para verificar os números e as condições do teste, consulte o post original e confira o hardware, a configuração e a métrica informados; os dados disponíveis aqui não detalham esses parâmetros.