Publicado em 25 de agosto de 2024, o VoiceCraft é descrito como um modelo de linguagem de codec neural para edição de fala e síntese de voz zero-shot. A publicação afirma que ele pode clonar ou editar uma voz não vista com alguns segundos de áudio de referência.
Publicado em 25 de agosto de 2024, o VoiceCraft é apresentado como um modelo de linguagem de codec neural para edição de fala e text-to-speech (TTS) zero-shot. Segundo a publicação, ele pode clonar ou editar uma voz não vista usando alguns segundos de áudio de referência.
O texto aponta a abordagem como algo que engenheiros podem avaliar em áudios variados, mas não apresenta resultados de testes ou medidas de desempenho. Para verificar o escopo e as evidências, consulte a publicação original e examine os materiais e avaliações que ela disponibiliza.