Destilação on-policy com múltiplos professores para combinar especialistas
Radar: o post descreve o MOPD, método em que um modelo aluno aprende com rollouts gerados por ele próprio e recebe supervisão de professores especializados por domínio, para reunir capacidades de especialistas treinados separadamente.
Segundo a descrição do post, datado de 6 de outubro de 2026, o MOPD treina um modelo student com rollouts gerados por ele próprio. Teachers especializados por domínio fornecem supervisão em nível de token, usando um objetivo de reverse KL amostrado. A proposta é combinar, em um único student, as capacidades de modelos especialistas treinados de forma independente.
Trata-se de uma técnica de treinamento de modelos. O texto-fonte não informa resultados quantitativos, e a Rota Nacional não oferece treinamento de modelos student com esse método. Para verificar escopo, data e achados, consulte o post original pelo título na sua coleção de bookmarks do Radar. Se você usar IA para estudar o material, não cole dados pessoais, contratos ou informações confidenciais nos prompts; a plataforma detecta CPF, CNPJ, e-mail, telefone e nomes e aplica a política da organização antes de qualquer modelo rodar.