O primeiro artigo da série deriva o estimador REINFORCE para policy gradients. O método permite estimar gradientes sem diferenciar através do ambiente, uma distinção importante quando o processo ambiental não é diferenciável ou não está disponível para diferenciação.
A proposta é entender como a política pode ser ajustada a partir de trajetórias e do retorno observado. Como estimador não enviesado, REINFORCE busca, em expectativa, o gradiente pretendido; isso não significa que cada estimativa individual seja precisa.
A variância é uma questão central: o artigo analisa como ela escala com o tamanho da trajetória. Ao estudar o método, observe quais quantidades são aleatórias, que retorno entra na estimativa e como trajetórias mais longas podem afetar a estabilidade das atualizações.
Para aplicar o material com IA, compartilhe apenas trechos públicos ou dados sintéticos. Não inclua trajetórias de usuários, registros internos ou credenciais; se precisar de ajuda para interpretar código, remova previamente qualquer dado pessoal e informação confidencial.