Pular para o conteúdo
Rota Nacional

Radar ·

MOPD combina capacidades de modelos especialistas

Publicado em 1º de outubro de 2026, o texto apresenta a destilação on-policy multi-teacher (MOPD): um método que treina um modelo student com suas próprias completions, usando log probabilities por token de modelos teacher e um objetivo de reverse KL.

Publicado em 1º de outubro de 2026, o texto descreve a destilação on-policy multi-teacher (MOPD) para modelos de linguagem. Nela, um modelo student é treinado com suas próprias completions, usando as log probabilities por token dos modelos teacher e um objetivo de reverse KL.

Uma configuração chamada consolidation transfere capacidades de especialistas de domínio treinados de forma independente para um student. A técnica é apresentada como uma maneira de combinar essas capacidades sem treinar os especialistas conjuntamente em multi-domain RL. Para consultar e verificar o método, leia a publicação original e confira nela a definição do objetivo, a configuração de consolidation e as evidências experimentais; o resumo disponível não informa resultados quantitativos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis