Modelo open-source de clonagem de voz Qwen3-TTS 1.7B CustomVoice
Post apresenta um modelo open-source de texto para fala de 1,7B com clonagem de voz e controles de emoção, idade, tom, sotaque e suporte multilíngue. As alegações de realismo e latência não foram verificadas.
Segundo o post, o Qwen3-TTS 1.7B CustomVoice é um modelo open-source de text-to-speech de 1,7 bilhão de parâmetros, voltado à clonagem de voz. Ele oferece controles de emoção, idade, tom e sotaque, além de suporte multilíngue. A fonte primária é o model card publicado na plataforma de modelos, que registra os detalhes oficiais. As afirmações do autor sobre realismo e latência não foram verificadas e devem ser tratadas como alegações até testes independentes.
Para equipes que avaliam TTS self-hosted, o caminho de checagem é ler no model card a licença, os idiomas suportados e a lista de controles, e depois testar com amostras próprias e autorizadas. A clonagem da voz de uma pessoa real exige consentimento e levanta riscos de fraude e identificação, por isso a voz é dado pessoal sensível para a organização. A Rota Nacional não apresenta este modelo como recurso próprio; a plataforma aplica a mesma barreira de dados pessoais à transcrição de áudio e à extração de documentos, e os recursos de voz estão em prévia.