Em 26 de setembro de 2026, uma publicação da Xiaomi MiMo apontou para ambientes de aprendizado por reforço, código de treinamento e um dataset MiMo-V2.6 RL para explorar fluxos de trabalho com modelos de linguagem.
Em 26 de setembro de 2026, a Xiaomi MiMo divulgou uma publicação sobre ambientes de aprendizado por reforço (RL) e código de treinamento. O material também aponta para um dataset MiMo-V2.6 RL. Segundo a descrição, esses recursos podem ajudar engenheiros a explorar ou desenvolver fluxos de trabalho de RL para modelos de linguagem.
Para conferir o anúncio, consulte os canais oficiais da Xiaomi MiMo e verifique diretamente o repositório indicado e a página do dataset. Compare a descrição com os arquivos e materiais publicados; o resumo disponível não informa detalhes sobre conteúdo, licença ou resultados de avaliação.