Pular para o conteúdo
Rota Nacional

Radar ·

ROME explora crédito por trechos no treino de agentes

Um modelo de 3 bilhões de parâmetros usa recompensas por trecho, em vez de atribuir crédito apenas por token ou trajetória, para treinar agentes que utilizam ferramentas.

A publicação descreve o ROME, um modelo de 3 bilhões de parâmetros treinado com IPA e recompensas atribuídas por trecho. O processo inclui pré-treinamento com tarefas de código estruturadas, ajuste supervisionado com mascaramento de erros e otimização por aprendizado por reforço em nível de trecho.

A ideia oferece uma alternativa ao crédito por token ou por trajetória no treinamento de agentes que usam ferramentas. O material não detalha resultados comparativos; organizações que estudarem ou aplicarem a abordagem com IA devem evitar inserir código, credenciais ou dados internos identificáveis e usar somente conteúdo autorizado.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis