O estudo analisa self-distillation com informação privilegiada — por exemplo, fornecer a solução de um problema de matemática — em modelos de raciocínio. Em cinco modelos Qwen3 e OLMo avaliados no AIME, relata degradação em trajetórias longas de raciocínio.
O resultado aponta um possível trade-off: a informação privilegiada pode ajudar a treinar modelos, mas não garante melhor desempenho em raciocínios extensos. Ao avaliar uma técnica semelhante, compare tarefas curtas e longas, em vez de se basear em uma única pontuação agregada.
Para testar a abordagem, defina previamente os conjuntos de avaliação e as métricas, mantenha uma referência sem a técnica e compare os resultados nas mesmas condições. Registre também como a informação privilegiada foi introduzida, para que outras pessoas possam interpretar ou reproduzir o experimento.
Se usar IA para estudar ou aplicar o material, não envie dados pessoais ou informações internas sem autorização. Aplique as regras da sua organização e, quando possível, use exemplos sintéticos ou anonimizados. O estudo reporta resultados experimentais; não estabelece que a técnica cause o mesmo efeito em todos os modelos ou tarefas.