أغلقت شركة Fish Audio الناشئة في مجال الذكاء الاصطناعي الصوتي جولة تمويل أولية بقيمة 52 مليون دولار — وهي من أضخم جولات التمويل الأولي في مجال الصوت الذكي — بعد عام واحد فقط من إطلاقها كمشروع جانبي. تخدم الشركة اليوم 8 ملايين مستخدم، وتحقق 21 مليون دولار إيرادات سنوية متكررة، ويضم قائمة عملائها التجاريين شركات كبرى مثل HeyGen وOpenAI وLiveKit.
أبرز النقاط
- جولة تمويل أولية بـ 52 مليون دولار بقيادة Coreline Ventures وCapital Today، مع مشاركة 359 Capital و645 Ventures وHF0 وغيرها
- 21 مليون دولار إيرادات سنوية و8 ملايين مستخدم تحققت خلال العام الأول من عمل الشركة
- نموذج S2.1 Pro يستنسخ أي صوت من مقطع صوتي مدته 5 ثوانٍ في أقل من 15 ثانية
- دعم 83 لغة مع أكثر من 15,000 أمر تحكم عاطفي باللغة الطبيعية
- أكثر من 31,000 نجمة على GitHub لمشروع Fish Speech مفتوح المصدر
نموذج S2.1 Pro
يمثّل نموذج S2.1 Pro العرض الرئيسي لشركة Fish Audio، وهو مصمم لوضع معيار جديد في مجال الكلام الاصطناعي الطبيعي والتعبيري. يستطيع النموذج استنساخ صوت أي شخص من خمس ثوانٍ فقط من الصوت المرجعي وإنتاج النتيجة في غضون 15 ثانية، مما يجعل تخصيص الصوت في الوقت الفعلي ممكناً على نطاق واسع للمرة الأولى.
في اختبارات استماع عمياء مستقلة، فضّل 67% من المستمعين صوت S2.1 Pro على النماذج المنافسة. ويُعزى هذا التميّز إلى أدوات التحكم التفصيلية في المشاعر — أكثر من 15,000 أمر باللغة الطبيعية تمكّن المطورين من ضبط التعبير والإيقاع والنبرة دون الحاجة إلى تدريب مخصص. يدعم النموذج 83 لغة ويوفر نشراً محلياً مع الامتثال لمعيار HIPAA، مما يفتح الباب أمام تطبيقات الرعاية الصحية والقانون والخدمات المالية.
يتوفر النموذج حالياً حصرياً عبر واجهة برمجة التطبيقات المدفوعة، وتخطط الشركة لإتاحته مجاناً لجميع المطورين في نهاية أغسطس 2026.
حضور تجاري قوي
تشمل قائمة عملاء الشركة أبرز أسماء منظومة الصوت الذكي. تستخدم HeyGen نماذج Fish Audio لتوليد مقاطع فيديو الصور الرمزية الناطقة. تدمج Retell AI وLiveKit نماذجها لعملاء الصوت منخفض الكمون. أما Telnyx وOpenArt فتكمّلان قاعدة عملاء تمتد عبر الإعلام والروبوتات واتصالات المؤسسات.
تصف الرئيسة التنفيذية والمؤسِّسة المشاركة ريسا كاو فرصة المنتج من حيث تنوع حالات الاستخدام: "كل مؤسسة لها احتياجاتها المختلفة — ستحتاج استوديوهات الألعاب إلى أصوات تعبيرية لشخصياتها"، فيما تحتاج شركات الاتصالات إلى "أصوات منخفضة الكمون وذات تعبيرية كافية للمكالمات."
من الإحباط إلى 52 مليون دولار
يعود تأسيس الشركة إلى إحباط المؤسس المشارك شيجيا ليو — الباحث السابق في NVIDIA — من الجودة الاصطناعية والآلية لنماذج الصوت القائمة. تعاون ليو مع كاو لبناء نموذج يبدو بشرياً، بدأ كمشروع مفتوح المصدر قبل أن يتحول إلى نجاح تجاري.
راكم مستودع Fish Speech على GitHub أكثر من 31,000 نجمة، وهو مؤشر مفتوح المصدر استثنائي لشركة في هذه المرحلة. هذا الجذب المجتمعي قاد إلى اعتماد مبكر واسع وأتاح للفريق ردود فعل حقيقية عبر اللغات وحالات الاستخدام قبل حتى إطلاق المنتج التجاري.
ما القادم
ستموّل الـ 52 مليون دولار ثلاثة أولويات: توسيع قائمة النماذج بنماذج لغوية كبيرة واعية للصوت وأدوات كلام إلى كلام، وتعميق التكاملات مع منصات المطورين كـ LiveKit وRetell AI، وبناء فريق مبيعات مؤسسية لتحويل الطلب الوافد الحالي إلى عقود طويلة الأجل.
تُشير خريطة الطريق إلى طموح أشمل: تريد Fish Audio امتلاك المنظومة الكاملة للذكاء الصوتي، لا مجرد تحويل النص إلى كلام. سيمكّنها نموذج فهم الصوت المخطط له ونموذج الكلام إلى الكلام من المنافسة في سوق تتسابق فيه OpenAI وElevenLabs وCartesia لتحديد طبقة الصوت في تطبيقات الذكاء الاصطناعي.
قالت كاو: "يصبح الصوت الواجهة الرئيسية للذكاء الاصطناعي. أرست Fish Audio سجلاً قوياً من خلال تطوير الأداء والقدرات متعددة اللغات والدقة العاطفية والقدرة على تحمل التكاليف."
المصدر: TechCrunch