A Salesforce apresenta o UserRL, um framework que combina ambientes gym padronizados e usuários simulados para treinar modelos agentic. O relato destaca escolhas sobre cold starts com SFT, recompensas por trajetória e treinamento escalável.
A Salesforce apresenta o UserRL, um framework que usa ambientes gym padronizados e usuários simulados para treinar modelos agentic. O relato aborda cold starts com SFT, recompensas por trajetória e treinamento escalável com usuários simulados.
Ao estudar o trabalho, separe essas três escolhas de treinamento e anote qual delas corresponde à questão que você quer investigar: inicialização, avaliação de trajetórias ou escala de treinamento.
Para aplicar ideias semelhantes, defina primeiro a interação multi-turn que deseja estudar e quais observações permitiriam comparar resultados. Trate essas escolhas como pontos de investigação, não como prova de que o framework resolve qualquer tarefa específica.
Se usar IA para estudar ou adaptar o material, evite inserir dados pessoais, confidenciais ou internos sem autorização. Prefira exemplos sintéticos ou devidamente desidentificados e confira as conclusões com a fonte original.