Publicado em 10 de outubro de 2025, o texto apresenta o uso de estados futuros das interações de um agente como supervisão, sem sinais de recompensa, e examina duas estratégias: modelagem implícita do mundo e autorreflexão.
Publicado em 10 de outubro de 2025, o post descreve uma abordagem chamada “early experience”: usar estados futuros das próprias interações do agente como supervisão, sem sinais de recompensa. O texto examina duas estratégias, modelagem implícita do mundo e autorreflexão, e situa a proposta em ambientes com recompensas não verificáveis ou sequências de interação longas e custosas.
A publicação apresenta o tema e essas estratégias, sem informar resultados quantitativos no material disponível. Para conferir o relato, consulte a postagem original pelo título e pela data; compare o escopo descrito e verifique se eventuais conclusões correspondem ao texto, sem inferir desempenho que não foi informado.