Em 22 de setembro de 2025, a Qwen anunciou a disponibilização de três modelos multimodais capazes de seguir instruções, raciocinar e gerar legendas, com entrada e saída de fala.
Em 22 de setembro de 2025, a Qwen afirmou ter disponibilizado três modelos Qwen3-Omni. Segundo o anúncio, eles seguem instruções, raciocinam e geram legendas; combinam texto, imagem, áudio e vídeo e aceitam e produzem fala.
O anúncio destaca o interesse para engenheiros que queiram explorar um modelo de código aberto que processa fala junto com outras modalidades. Para confirmar o escopo e os detalhes técnicos, consulte o anúncio original da Qwen e compare suas afirmações com a documentação e os materiais do modelo; o texto disponível não informa resultados de benchmarks.