WeightWatch sinaliza colapso tardio da generalização
Um trabalho relata sinais de anti-grokking nas matrizes de pesos em dois experimentos com treinamento prolongado: um MLP de três camadas em um subconjunto do MNIST e um transformer treinado em adição modular.
Publicado em 4 de fevereiro de 2026, o relato descreve o anti-grokking como um colapso tardio da generalização. O trabalho explora se a análise dos pesos pode revelar essa perda durante treinamentos prolongados. Os experimentos citados usam um MLP de três camadas em um subconjunto do MNIST e um transformer treinado em adição modular; o post afirma que o WeightWatcher detecta sinais nas matrizes de pesos.
Para avaliar o resultado, consulte o paper original citado no bookmark e confira nele os métodos, as métricas e os limites dos experimentos; o resumo disponível não informa esses detalhes. Ao tentar reproduzir os achados, compare os resultados nas condições descritas no paper, sem extrapolá-los para outros modelos ou tarefas. Se usar IA para estudar ou aplicar o trabalho, não envie dados organizacionais sensíveis sem autorização e aplique a política de proteção de dados da sua organização.