TMAX treina agentes de terminal em ambientes Dockerizados
Post publicado em 24 de junho de 2026 descreve 14,6 mil ambientes Dockerizados de aprendizado por reforço e uma receita DPPO baseada apenas em resultados. Relata 27% no Terminal-Bench 2.0 para um modelo 9B.
Publicado em 24 de junho de 2026, o post sobre TMAX descreve 14,6 mil ambientes Dockerizados de aprendizado por reforço (RL) e uma receita DPPO que usa apenas resultados no treinamento de agentes de terminal. O texto relata que um modelo 9B alcançou 27% no Terminal-Bench 2.0.
Segundo o post, a receita e o desenho dos ambientes podem ajudar engenheiros a treinar agentes para tarefas de shell com vários turnos. Para avaliar o resultado, consulte a publicação original e confira como ela define a métrica, o benchmark e as condições de teste; os dados do resumo, por si só, não estabelecem comparabilidade com outras avaliações.