O Luce PFlash, servidor de inferência especulativa para LLMs em hardware heterogêneo e GPUs de consumo, recebeu cache de prefixo, ajustes de cold start e uma correção de CUDA VMM.
O autor relata desempenho cerca de 10 vezes mais rápido em condições warm e 2,5 vezes em cold, com autotune de block sparse attention, para o Qwen3.6 27B. Esses números são resultados relatados para essa configuração, não uma garantia para outras cargas ou máquinas.
Ao estudar ou adaptar o projeto com ferramentas de IA, evite enviar prompts, logs ou exemplos que contenham dados pessoais ou segredos da organização. Use amostras sintéticas ou anonimizadas e verifique o que será registrado antes de compartilhar material interno.
Para avaliar a técnica, registre separadamente as condições de teste — hardware, estado warm ou cold e configuração — e compare resultados com uma referência reproduzível. O relato descreve uma implementação; não significa que a Rota Nacional implemente essas otimizações ou resolva os desafios de engenharia do projeto.