Publicado em 1º de outubro de 2026, o texto apresenta a destilação on-policy multi-teacher (MOPD): um método que treina um modelo student com suas próprias completions, usando log probabilities por token de modelos teacher e um objetivo de reverse KL.
Publicado em 1º de outubro de 2026, o texto descreve a destilação on-policy multi-teacher (MOPD) para modelos de linguagem. Nela, um modelo student é treinado com suas próprias completions, usando as log probabilities por token dos modelos teacher e um objetivo de reverse KL.
Uma configuração chamada consolidation transfere capacidades de especialistas de domínio treinados de forma independente para um student. A técnica é apresentada como uma maneira de combinar essas capacidades sem treinar os especialistas conjuntamente em multi-domain RL. Para consultar e verificar o método, leia a publicação original e confira nela a definição do objetivo, a configuração de consolidation e as evidências experimentais; o resumo disponível não informa resultados quantitativos.