Fish Audio
Hanabi AI Inc.
Síntese de voz expressiva em tempo real e clonagem a partir de 15 segundos, em mais de 30 idiomas.

Plataformas
Visão geral
O Fish Audio é uma plataforma de IA de voz operada pela Hanabi AI Inc. Seu modelo mais recente, o S2.1 Pro, é descrito como o modelo de voz em tempo real mais expressivo e com maior controle emocional, com marcadores como [laughing] ou [whispering] para indicar emoção e forma de falar. A plataforma oferece clonagem de voz a partir de 15 segundos de áudio, reconhecimento de fala e APIs para agentes de voz, com suporte a mais de 30 idiomas e uma biblioteca pública com mais de 2 milhões de vozes. O plano gratuito é apenas para uso pessoal; o uso comercial exige um plano pago. A interface está disponível em vários idiomas.
Principais recursos
- Síntese de voz com marcadores de emoção (S2.1 Pro)
- Clonagem de voz com 15 segundos de áudio
- Reconhecimento de fala (Speech to Text)
- APIs para agentes de voz
- Mais de 30 idiomas
- Biblioteca com mais de 2 milhões de vozes
- Interface em vários idiomas
Casos de uso recomendados
Produção de áudio
- Narração de vídeos
- Audiolivros
- Vozes de personagens
- Chatbots de voz
Preços
Preço ainda não verificado — confira no site oficial.
Capturas de tela

Ferramentas de IA relacionadas
ElevenLabs
ElevenLabs é um serviço de geração de voz com IA que pode ser usado em narração e dublagem.
Cartesia
APIs de síntese de voz e reconhecimento de fala em tempo real, voltadas à criação de agentes de voz.
Murf AI
Murf AI é um serviço de IA de geração de voz que pode ser usado para narração e produção de vídeos.
Hume AI
APIs de voz centradas na emoção: síntese de voz, interface de voz conversacional e medição da expressão.