Modelo TTS de voz única destilado do Kokoro-82M com 9MB
Post relata modelo de text-to-speech de voz e idioma únicos, com cerca de 9MB de pesos, destilado do Kokoro-82M, de 8M de parâmetros. O autor afirma execução em qualquer lugar e alta velocidade, sem verificação independente.
Radar registra um post que descreve um modelo de text-to-speech (TTS) de voz e idioma únicos, com cerca de 9MB de pesos. Segundo o texto, o modelo foi destilado do Kokoro-82M, que tem 8M de parâmetros. O autor afirma que o modelo roda em qualquer lugar e é muito rápido. Essas são afirmações do autor; o resumo não traz medições, metodologia de avaliação, qualidade de áudio, licença nem data de publicação do modelo.
A relevância para organizações está no conceito, não em um recurso da Rota Nacional. Um TTS destilado e pequeno pode, em tese, permitir saída de voz local e rápida em dispositivos com recursos limitados. Para verificar o alcance real, consulte o post original, a documentação do modelo e os testes de desempenho publicados pelos autores. A Rota Nacional não fornece esse modelo nem afirma capacidade de síntese de voz neste item; voz está em prévia na plataforma.