ROME explora crédito por trechos no treino de agentes
Um modelo de 3 bilhões de parâmetros usa recompensas por trecho, em vez de atribuir crédito apenas por token ou trajetória, para treinar agentes que utilizam ferramentas.
A publicação descreve o ROME, um modelo de 3 bilhões de parâmetros treinado com IPA e recompensas atribuídas por trecho. O processo inclui pré-treinamento com tarefas de código estruturadas, ajuste supervisionado com mascaramento de erros e otimização por aprendizado por reforço em nível de trecho.
A ideia oferece uma alternativa ao crédito por token ou por trajetória no treinamento de agentes que usam ferramentas. O material não detalha resultados comparativos; organizações que estudarem ou aplicarem a abordagem com IA devem evitar inserir código, credenciais ou dados internos identificáveis e usar somente conteúdo autorizado.