Um paper descreve um método que escolhe dinamicamente, token a token, entre supervisão baseada no teacher e no próprio modelo.
O paper apresenta a Dual On-Policy Distillation, uma abordagem que roteia dinamicamente a supervisão de cada token entre duas fontes: o teacher e o próprio modelo. A descrição disponível não detalha resultados experimentais nem informa em que condições cada fonte é escolhida.
A proposta pode interessar a engenheiros que estudam alternativas à destilação padrão com teacher e à self-distillation. Ao usar IA para analisar ou aplicar o método, evite inserir dados pessoais, código confidencial ou outros dados internos sem autorização; use exemplos sintéticos ou anonimizados quando possível.