Publicado em 18 de setembro de 2024, Moshi é apresentado como um modelo de fala para fala com 7,6 bilhões de parâmetros e acompanhado pelo codec de áudio em streaming Mimi.
A publicação descreve Moshi como um modelo de fala para fala com 7,6 bilhões de parâmetros, acompanhado pelo Mimi, um codec de áudio em streaming. O lançamento inclui checkpoints e código de inferência para Candle, PyTorch e MLX.
Engenheiros podem avaliar o modelo e executar inferência usando diferentes frameworks e hardwares. Consulte a publicação original para detalhes e verifique os checkpoints, o código e os requisitos antes de testar; o resumo disponível não informa resultados comparativos nem desempenho específico.