A técnica combina propostas de um modelo eficiente com verificações paralelas de um modelo maior para reduzir etapas seriais de decoding sem alterar a distribuição de saída.
Speculative decoding é uma técnica para acelerar a inferência autoregressiva, que gera a saída token por token. A proposta é reduzir a quantidade de etapas seriais do processo.
Um modelo eficiente propõe vários tokens. Em seguida, um modelo maior verifica essas propostas em paralelo.
O método busca acelerar a amostragem sem mudar a distribuição de saída do modelo. O texto descreve a técnica, mas não informa resultados de desempenho nem garante aceleração em todos os cenários.
Ao estudar ou testar a abordagem com IA, evite inserir dados pessoais, segredos ou conteúdo interno sem necessidade. Aplique as regras de proteção de dados da organização e use material autorizado.