Pular para o conteúdo
Rota Nacional

Radar ·

Moshi: modelo aberto de fala para fala

Publicado em 18 de setembro de 2024, Moshi é apresentado como um modelo de fala para fala com 7,6 bilhões de parâmetros e acompanhado pelo codec de áudio em streaming Mimi.

A publicação descreve Moshi como um modelo de fala para fala com 7,6 bilhões de parâmetros, acompanhado pelo Mimi, um codec de áudio em streaming. O lançamento inclui checkpoints e código de inferência para Candle, PyTorch e MLX.

Engenheiros podem avaliar o modelo e executar inferência usando diferentes frameworks e hardwares. Consulte a publicação original para detalhes e verifique os checkpoints, o código e os requisitos antes de testar; o resumo disponível não informa resultados comparativos nem desempenho específico.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis