La startup de voix IA Fish Audio vient de boucler un tour de table seed de 52 millions de dollars — l'un des plus importants dans le domaine de l'audio IA — seulement un an après son lancement comme projet secondaire. La société compte désormais 8 millions d'utilisateurs, génère 21 millions de dollars de revenus récurrents annuels et compte parmi ses clients HeyGen, OpenAI et LiveKit.
Points clés
- Tour seed de 52 M$ co-mené par Coreline Ventures et Capital Today, avec la participation de 359 Capital, 645 Ventures, HF0 et d'autres
- 21 M$ ARR et plus de 8 millions d'utilisateurs atteints lors de la première année d'activité
- Le modèle S2.1 Pro clone toute voix à partir d'un clip audio de 5 secondes en environ 15 secondes
- 83 langues supportées avec plus de 15 000 commandes de contrôle émotionnel en langage naturel
- Plus de 31 000 étoiles GitHub pour Fish Speech, le projet de synthèse vocale open source
Le modèle S2.1 Pro
L'offre phare de Fish Audio, S2.1 Pro, est conçu pour établir un nouveau standard dans la parole synthétique expressive et naturelle. Le modèle peut cloner une voix à partir de seulement cinq secondes d'audio de référence et produire un résultat en 15 secondes, rendant pour la première fois la personnalisation vocale en temps réel réalisable à grande échelle.
Lors de tests d'écoute en aveugle indépendants, S2.1 Pro a été préféré par 67% des auditeurs face aux modèles concurrents. Cet écart est attribué aux commandes d'émotion granulaires du modèle — plus de 15 000 instructions en langage naturel permettant aux développeurs d'ajuster l'expressivité, le rythme et le ton sans entraînement personnalisé. Le modèle supporte 83 langues et offre un déploiement sur site avec conformité HIPAA, ouvrant la porte aux cas d'usage dans la santé, le juridique et la finance.
Actuellement disponible exclusivement via l'API payante de Fish Audio, la société prévoit de rendre S2.1 Pro gratuit pour tous les développeurs via son API officielle dès fin août 2026.
Traction entreprise
La liste de clients de la société ressemble à un annuaire de la couche voix IA. HeyGen utilise les modèles Fish Audio pour alimenter la génération de vidéos avec avatars parlants. Retell AI et LiveKit les intègrent pour des agents vocaux à faible latence. Telnyx et OpenArt complètent une base clients couvrant les médias, la robotique et les communications entreprises.
La PDG et co-fondatrice Rissa Cao cadre l'opportunité produit en termes de diversité des cas d'usage : "Chaque entreprise a des besoins différents — un studio de jeux voudra des voix expressives pour ses personnages," tandis que les sociétés de communication ont besoin de "voix à faible latence suffisamment expressives pour les appels."
De la frustration à 52 M$
La genèse de la société remonte à la frustration du co-fondateur Shijia Liao — ancien chercheur chez NVIDIA — face à la qualité synthétique et robotique des modèles de voix existants. Liao s'est associé à Cao pour construire un modèle qui sonne humain, commençant comme projet open source avant que la dynamique commerciale ne prenne le dessus.
Le dépôt Fish Speech a accumulé plus de 31 000 étoiles GitHub, un signal open source exceptionnellement fort pour une société à ce stade. Cet attrait communautaire a conduit à une adoption précoce et fourni à l'équipe des retours réels dans plusieurs langues et cas d'usage avant même le lancement du produit entreprise.
Et après
Les 52 millions financeront trois priorités : élargir la gamme de modèles avec des grands modèles de langage natifs à la voix et des outils de parole à parole, approfondir les intégrations avec les plateformes développeurs comme LiveKit et Retell AI, et construire une équipe commerciale entreprise pour convertir la demande entrante actuelle en contrats long terme.
La feuille de route signale une ambition plus large : Fish Audio veut posséder toute la pile d'intelligence audio, pas seulement la synthèse vocale. Un modèle de compréhension audio planifié et un modèle de parole à parole lui permettraient de concurrencer dans un marché où OpenAI, ElevenLabs et Cartesia se disputent tous la définition de la couche voix des applications IA.
"La voix devient l'interface principale pour l'IA," a déclaré Cao. "Fish Audio a établi un solide palmarès en faisant progresser les performances, les capacités multilingues, les nuances émotionnelles et l'accessibilité tarifaire."
Source : TechCrunch