Um estudo investiga pré-treinamento escalável a partir de inicialização aleatória, usando um gerador de programas e um aprendiz, sem treinar com dados reais.
O trabalho explora se o self-play pode viabilizar pré-treinamento escalável sem treinar com dados reais. A partir de inicialização aleatória, um gerador propõe programas para uma máquina de Turing universal, e um aprendiz é treinado com os resultados.
O estudo relata reduções previsíveis na loss de validação zero-shot em imagens, texto, áudio e melodias, além de resultados de aprendizagem in-context. Se usar IA para estudar ou aplicar essa abordagem, evite enviar dados pessoais ou documentos internos sem autorização e aplique as regras de proteção de dados da organização.