Pular para o conteúdo
Rota Nacional

Radar ·

TMAX treina agentes de terminal em ambientes Dockerizados

Post publicado em 24 de junho de 2026 descreve 14,6 mil ambientes Dockerizados de aprendizado por reforço e uma receita DPPO baseada apenas em resultados. Relata 27% no Terminal-Bench 2.0 para um modelo 9B.

Publicado em 24 de junho de 2026, o post sobre TMAX descreve 14,6 mil ambientes Dockerizados de aprendizado por reforço (RL) e uma receita DPPO que usa apenas resultados no treinamento de agentes de terminal. O texto relata que um modelo 9B alcançou 27% no Terminal-Bench 2.0.

Segundo o post, a receita e o desenho dos ambientes podem ajudar engenheiros a treinar agentes para tarefas de shell com vários turnos. Para avaliar o resultado, consulte a publicação original e confira como ela define a métrica, o benchmark e as condições de teste; os dados do resumo, por si só, não estabelecem comparabilidade com outras avaliações.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis