Fish Audio a annoncé mardi une levée d'amorçage de 52 millions de dollars, un an après la création de l'entreprise, avec 21 millions de dollars de revenus récurrents annuels et plus de 8 millions d'utilisateurs derrière elle. Le chemin parcouru est la partie qui mérite lecture : un ancien chercheur de NVIDIA a entraîné des modèles vocaux sur un seul GPU de jeu, a publié le résultat sous le nom de Fish Speech, et l'a vu récolter plus de 31 000 étoiles sur GitHub. La société propose aujourd'hui cinq modèles couvrant la synthèse et la reconnaissance vocale dans plus de 83 langues. Trois sont ouverts et auto hébergeables. Le meilleur est réservé à l'API payante, ce qui résume tout le modèle économique.
The short answer
Fish Audio a annoncé le mardi vingt huit juillet une levée d'amorçage de 52 millions de dollars, co menée par Coreline Ventures et Capital Today, avec la participation de 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners et Bayhouse Ventures. L'entreprise déclare 21 millions de dollars de revenus récurrents annuels et plus de 8 millions d'utilisateurs à son premier anniversaire. Elle propose cinq modèles, quatre pour la génération vocale et un pour la reconnaissance, couvrant plus de 83 langues, dont trois des quatre modèles de génération publiés en poids ouverts, S2.1 Pro restant réservé à l'API payante.
L'histoire fondatrice occupe beaucoup de place dans la couverture médiatique, et pour une fois elle porte réellement quelque chose. Shijia Liao, ancien chercheur chez NVIDIA, était assez agacé par les voix synthétiques plates pour entraîner ses propres modèles sur un seul GPU de jeu. Le résultat est sorti sous le nom de Fish Speech.
Les poids ouverts d'abord, l'entreprise ensuite
Cet ordre explique presque tout le reste. Fish Speech a récolté plus de 31 000 étoiles GitHub avant qu'une activité commerciale n'y soit rattachée. Quand Liao et Rissa Cao, aujourd'hui directrice générale, ont eu une société, ils disposaient déjà de la base d'utilisateurs que la plupart des jeunes pousses en amorçage passent leur tour de table à acheter.
Un an plus tard, les chiffres publiés avec la levée sont de 21 millions de dollars de revenus récurrents annuels et plus de 8 millions d'utilisateurs, versions ouvertes et hébergées confondues. Le tour se monte à 52 millions de dollars, co mené par Coreline Ventures et Capital Today, avec 359 Capital, Play Time, HF0, 645 Ventures, Parable, Carya Venture Partners, Alphalist Partners et Bayhouse Ventures à leurs côtés.
Appeler cela une amorce relève de la formalité. Ce que les investisseurs ont acheté est une distribution qui existait déjà.
La partie qui compte si vous construisez quelque chose
Cinq modèles. Quatre génèrent de la parole, un la transcrit. Trois des quatre modèles de génération sont ouverts et auto hébergeables. S2.1 Pro, le plus performant, est réservé à l'API payante.
Cette séparation est le modèle économique énoncé sans détour, et nous préférons le voir énoncé sans détour plutôt que brouillé. Elle vous indique aussi exactement quelle doit être votre première expérience. Si vous avez une charge qui produit ou consomme de la parole en volume, exécutez les poids ouverts sur votre propre audio et voyez s'ils franchissent votre seuil. Ce seul test décide si la facturation à la requête est un coût dont vous êtes prisonnier ou un coût que vous payiez par habitude.
Deux détails méritent d'être connus avant de commencer. Les modèles couvrent plus de 83 langues, une amplitude inhabituelle pour des poids vocaux ouverts et le genre de couverture coûteuse à reproduire. Et la plateforme expose ce que l'entreprise décrit comme plus de 15 000 contrôles en langage naturel sur l'interprétation, une surface importante à apprendre mais la raison pour laquelle le résultat ne sonne pas plat.
Pourquoi la voix diffère du reste de la pile IA
La plupart des débats sur l'auto hébergement d'un modèle se ramènent au coût. La voix est le cas où ils se ramènent d'ordinaire aux données.
L'entrée d'une chaîne vocale est personnelle d'une manière qu'une invite textuelle n'est pas : appels de support enregistrés, audio de réunion, la voix d'une personne soumise pour clonage. En environnement réglementé, la question de savoir si cet audio quitte votre réseau est souvent tranchée avant que quiconque ne regarde une grille tarifaire. Une option en poids ouverts qui tourne sur votre matériel change ce qui est possible à cet endroit, et c'est là que réside la portée pratique de cette annonce, davantage que dans le montant du chèque.
La contrepartie est réelle. L'auto hébergement veut dire que vous portez le service, la latence et la capacité GPU, et que vous utilisez le niveau ouvert plutôt que le meilleur modèle. Pour une chaîne de transcription par lots, le choix est facile. Pour un agent vocal temps réel dont le budget de latence se compte en dizaines de millisecondes, c'est un projet.
À quoi sert l'argent
Le plan annoncé est de dépasser la synthèse vocale pour aller vers ce que l'entreprise appelle la pile audio native complète : des modèles de langage nativement vocaux où la parole est l'entrée et la sortie plutôt qu'une enveloppe autour d'un modèle textuel, la traduction parole vers parole, et un modèle de compréhension audio cette année.
La moitié la moins spectaculaire du plan est plus instructive. Une équipe commerciale entreprise, plus un outillage développeur et des intégrations plus poussés avec des partenaires d'infrastructure vocale. Une société avec 8 millions d'utilisateurs et 21 millions de dollars de revenus n'a pas de problème de distribution. Elle a un problème de conversion, et c'est à cela que servent une équipe commerciale et de meilleures intégrations.
Sources et pour aller plus loin
- TechCrunch : Fish Audio lève 52 M$ en amorçage pour ses modèles vocaux
- Annonce Fish Audio sur PR Newswire
- SiliconANGLE : Fish Audio lève 52 M$ en amorçage pour ses voix IA
- Unite.AI : Fish Audio transforme des modèles vocaux ouverts en revenus
- Fish Audio
Questions fréquentes
Quels modèles de Fish Audio sont réellement ouverts ?
Il existe cinq modèles. Quatre génèrent de la parole et un la transcrit. Trois des quatre modèles de génération sont publiés en open source et peuvent être auto hébergés, ce qui couvre les cas courants de synthèse vocale et de clonage de voix. Le quatrième, S2.1 Pro, n'est pas ouvert et n'est accessible que par l'API payante. Si vous évaluez cette pile pour un produit, cette séparation est la première chose à tester et non la dernière, car l'écart de qualité entre le niveau ouvert et le niveau payant décidera de votre architecture. Mesurez les poids ouverts sur votre propre audio avant de supposer qu'ils suffisent ou qu'ils ne suffisent pas.
Qu'apporte l'auto hébergement ici ?
La maîtrise de l'endroit où va l'audio et du coût marginal d'une requête. Le traitement de la voix est particulier parmi les charges IA parce que l'entrée est souvent personnelle : appels enregistrés, audio de support client, la voix d'une personne soumise pour clonage. Faire tourner le modèle sur votre propre matériel signifie que rien de tout cela ne quitte votre réseau, ce qui est fréquemment le facteur décisif en environnement réglementé, quelles que soient les promesses du fournisseur. La contrepartie est que vous héritez du problème de service, du réglage de la latence et du dimensionnement GPU, et que vous êtes sur le niveau ouvert plutôt que sur le meilleur modèle. Pour une chaîne par lots, l'arbitrage est simple. Pour un agent en temps réel, beaucoup moins.
52 millions de dollars, est ce inhabituel pour une amorce ?
C'est très élevé pour l'étiquette, et l'étiquette en dit moins que les métriques. Une entreprise qui déclare 21 millions de dollars de revenus récurrents annuels et 8 millions d'utilisateurs n'est pas au stade que le mot amorçage décrit habituellement, quel que soit le nom donné au tour. Ce que reflète cette taille, c'est que le projet open source est venu en premier et l'entreprise ensuite : Fish Speech avait accumulé plus de 31 000 étoiles GitHub et une vraie base d'utilisateurs avant qu'il y ait grand chose à financer. Les investisseurs ont valorisé une distribution déjà existante plutôt qu'un plan pour l'acquérir.
Que prévoit l'entreprise de construire ensuite ?
La direction annoncée est de dépasser la synthèse vocale pour aller vers ce que l'entreprise appelle la pile audio native complète. Cela signifie des grands modèles de langage nativement vocaux, où la parole est l'entrée et la sortie plutôt qu'une couche greffée sur un modèle textuel, ainsi que la traduction parole vers parole et un modèle de compréhension audio attendu cette année. L'autre usage annoncé de l'argent est moins spectaculaire et plus parlant : une équipe commerciale entreprise, et un outillage développeur et des intégrations plus poussés avec des partenaires d'infrastructure vocale. Une société avec 8 millions d'utilisateurs et 21 millions de dollars de revenus a un problème de conversion, pas de distribution.
Cela doit il changer ce que je construis aujourd'hui ?
Seulement si votre pile vocale actuelle vous déplaisait déjà. L'enseignement utile n'est pas le montant levé, c'est qu'une option crédible en poids ouverts existe désormais dans une catégorie où les valeurs par défaut sont des API fermées. Si vous exploitez une chaîne qui génère ou transcrit de la parole en volume, exécuter les poids ouverts de Fish Speech sur votre audio réel est une expérience peu coûteuse qui vous apprend quelque chose de concret : si le niveau ouvert franchit votre seuil de qualité, et donc si la tarification à la requête est un coût que vous devez réellement continuer à payer.