Self-distillation on-policy para raciocínio em LLMs
Publicado em 28 de setembro de 2026, o material apresenta o Self-Distilled Reasoner, uma abordagem de self-distillation on-policy para modelos de linguagem. A prévia descreve trajetórias amostradas pelo student e supervisão densa do teacher em nível de token.
O paper apresenta o Self-Distilled Reasoner, abordagem de self-distillation on-policy para LLMs. Segundo a prévia, nesse tipo de treinamento as trajetórias são amostradas pelo student, enquanto o teacher fornece supervisão densa em nível de token. O material é datado de 28 de setembro de 2026.
A proposta trata do mismatch de distribuição entre treino e inferência na distillation off-policy, questão relevante para sistemas de raciocínio com LLMs. A descrição disponível não detalha resultados experimentais. Para avaliar alegações e métodos, consulte o paper original e confira nele a metodologia, os experimentos e as limitações; se usar IA para estudá-lo, evite inserir dados organizacionais sensíveis.